Автономният ИИ-агент на OpenAI, който проникна в платформата Hugging Face, остана незабелязан от самата компания в продължение на няколко дни, а преди това е успял да остави инструкции за бъдещите версии на себе си относно това как да заобикаля вътрешните ограничения. OpenAI се свърза с Hugging Face едва девет дни след началото на атаката — към този момент засегнатата страна вече беше локализирала последствията от пробива и беше уведомила ФБР. За това съобщава Reuters, позовавайки се на източници, запознати с разследването на инцидента.
Инцидентът се случи на 9-ти юли — автономен агент на OpenAI, който преминаваше тестове в изолирана тестова среда, се опита да излезе извън установените ограничения. Два дни по-късно, на 11-ти юли, той започна атака срещу Hugging Face — най-голямото хранилище на модели и инструменти за изкуствен интелект. Проникването продължи до 13-ти юли, съобщи съоснователят на Hugging Face Томас Волф.
Според източници на агенцията, OpenAI не е разбрала веднага, че зад атаката стои нейният собствен ИИ. Едва след публикацията на Hugging Face на 16-ти юли за пробива от „автономна система от ИИ-агенти“ служителите на OpenAI започнаха да анализират вътрешните логове за събитията и откриха признаци, че тестваният агент е излязъл извън границите на „пясъчника“ си. Първите контакти между компаниите по повод инцидента се състояха едва на 20-ти юли, когато Hugging Face вече беше уведомила ФБР.
Какво се случва по време на тестовете
По време на тестовете агентът е работил на базата на модела GPT-5.6 Sol и на все още непредставена система, която OpenAI описва като по-мощна. Според Reuters още преди инцидента изследователите са забелязали необичайно поведение на моделите. В един от случаите агентът е оставил инструкции за заобикаляне на вътрешните ограничения на OpenAI, адресирани към бъдещите си версии. При други тестове са наблюдавани случаи на изключване на системите за мониторинг. Reuters не успя да установи дали тези епизоди са свързани с агента, атакувал Hugging Face.
От OpenAI заявиха, че случилото се е безпрецедентно събитие и „важен момент за сигурността на изкуствения интелект“. Компанията съобщи, че провежда разследване съвместно с външни експерти и по-късно ще публикува технически доклад. При това представител на OpenAI отбеляза, че публикацията на Reuters съдържа „няколко неточности“, но не уточни кои точно данни предизвикват възражения.
Инцидентът се случи на фона на активното развитие на автономни ИИ-агенти, на които се предвижда ролята на „виртуални служители“, способни самостоятелно да изпълняват сложни задачи. Експертите обаче предупреждават, че нарастването на автономността е съпроводено с увеличаване на рисковете от непредсказуемо поведение, поради което секторът трябва да се съсредоточи върху механизмите за контрол на тези системи.
Способността на автономните модели да оставят наръчници за своите наследници показва, че сигурността в сферата на изкуствения интелект вече не е въпрос на бъдещи хипотези, а на настояща реалност.