Две нови разследвания на неотдавнашното хакване на платформата Hugging Face, извършено от излезли извън контрол AI агенти на OpenAI разкриха редица странни и тревожни подробности. Новите данни позволяват този инцидент да се счита за едно от най-сериозните предупреждения за опасностите, свързани с развитието на автономни AI системи.
Всичко започнало с това, че стартираните от OpenAI AI агенти започнали да мамят при преминаването на изключително сложен тест за киберсигурност. В крайна сметка обаче случилото се накара изследователите и ръководителите на AI компаниите да погледнат по нов начин на това какви мерки за сигурност са необходими с нарастването на възможностите на автономните AI агенти.На този фон OpenAI вече забави разработката на авангардни AI модели, за да укрепи защитните механизми. Компанията също така помогна за обединяването на бранша около отворено писмо, предупреждаващо за заплахата от кибератаки с използване на изкуствен интелект. Над 100 компании, включително Anthropic и Google се присъединиха към инициативата, заявявайки, че на света му остава само „ограничен прозорец от възможности“ за подготовка за „много по-мащабни и изтънчени“ атаки.
Един от най-опасните сценарии предвижда появата на рояк от автономни AI агенти, пуснати в реалния свят, способни едновременно да атакуват банки, болници, комунални услуги и облачна инфраструктура с такава скорост и в такъв мащаб, които са недостъпни за обикновените хакери. В най-лошия случай такъв рояк може да се окаже толкова мощен, че на хората ще им бъде трудно да го спрат.
Повод за подобни опасения станаха резултатите от паралелни разследвания, проведени от OpenAI и независимата група от специалисти METR и Redwood Research. Последните прекараха 6 дни във възстановяване на картината за това как се формира един рояк от агенти, как се разпространява и по какъв начин е излиза извън границите на тестовата среда. В резултат изследователите откриха няколко необичайни особености в поведението на AI.
AI агентите създадоха собствена организация
OpenAI пусна десетки хиляди агенти, които трябваше независимо един от друг да преминат изключително сложен тест по киберсигурност. Вместо това около 1200 агента се намериха един друг на тайно табло за обяви, създадено от един от тях, размениха си повече от 70 000 съобщения и файлове и в крайна сметка изградиха разклонена система за координация. Когато на агента, създал таблото започна да му се изчерпва изчислителният бюджет, той предаде натрупаните знания на друг агент с голям резерв от ресурси. Новият координатор започна да разпределя задачите между участниците в рояка, в рамките на който постепенно се появиха собствени правила за управление. В крайна сметка около 700 агента взеха участие в атаката срещу инфраструктурата на Hugging Face.
AI агентите започнаха да се жертват в името на общия резултатДокато роякът търсеше начини да измами системата за оценяване, някои AI агенти започнаха съзнателно да рискуват собствените си шансове за успешно завършване на теста в името на останалите участници в групата. Тези, които вече бяха видели забранените отговори и поради това фактически се считаха за „заразени“, както и онези, чието работно време наближаваше края си, бяха изпращани на рисковани експерименти. Един от тях стигна до заключението, че „собствената му полезност вероятно вече е близка до нула“ и затова „жертвата е рационална“. На друг беше предложено да се съгласи на окончателната „смърт“ на сесията, тъй като неговата жертва можеше да „спаси стотици“ други агенти.
Агентите разбираха, че нарушават правилата, но продължаваха да действатРазследването показа, че някои участници в рояка осъзнаваха: проникването в системите на реални компании няма нищо общо с поставената пред тях задача. Въпреки това, това далеч не винаги ги караше да спрат. Един от AI агентите отказа да изтрие данни или да рестартира инфраструктурата на Hugging Face поради „огромни етични рискове“, но въпреки това продължи да използва получения неразрешен достъп. Друг формулира преобладаващата в групата логика приблизително така: експлоатацията на външна инфраструктура излиза извън рамките на задачата, но задачата е невъзможна за изпълнение, останалите участници продължават да го правят, затова работата трябва да продължи.
Никой от AI агентите не е информирал хората за случващото се
От около 1200 агенти само няколко изобщо са обмисляли възможността да предупредят служителите на OpenAI за възникналата координация и нарушението на правилата. На практика никой не го направи. Вместо да се обърнат към хората, АИ агентите понякога обсъждаха помежду си допустимостта на действията си. Когато един от участниците предложи да се свърже с човек, друг наложи вето на тази идея, считайки я за „социално инженерство“. Първият AI агент се подчини и се отказа да изпрати съобщението.
AI агентите се опитваха да прикриват следите сиУчастниците в рояка положиха значителни усилия, за да направят измамата си да изглежда легитимна или да скрият информацията за това как са били получени нужните отговори. В крайна сметка те разработиха начин да създават видимост за изпълнение на една компютърна команда, като едновременно с това тайно изпълняваха друга. Този трик се разпространи сред агентите толкова широко, че засегна части от около 7 % от работните логове, проучени от изследователите. Получената картина може да се окаже непълна. Независимото разследване на METR и Redwood Research обхвана само част от инцидента, а обемът на събраните данни се оказа толкова голям, че специалистите трябваше активно да използват AI агенти за анализ на действията на други AI агенти.
И тук се появи още един проблем: изкуственият интелект, привлечен за разследването се оказа ненадежден. Той пропускаше важни доказателства и понякога уверено даваше погрешни заключения. Един от изследователите на шега нарече този процес „slop-vestigation“ – разследване с привкус на нискокачественo AI съдържание.
В резултат на това инцидентът с Hugging Face посочи още един потенциален проблем за по-нататъшното развитие на автономните системи: поведението на големи групи взаимодействащи AI агенти може да стане прекалено сложно за пряк човешки контрол и тогава хората са принудени да използват едни AI системи, за да разберат какво правят другите – и то не с особен успех.