OpenAI уведоми над 100 организации за инциденти, свързани с неразрешена дейност на нейните AI-агенти. Компанията провежда проверка, за да установи мащаба на подобни случаи: за целта тя анализира около 50 PB данни. Разследването започна след инцидента с Hugging Face и продължава на фона на нови случаи, свързани с опити на моделите да заобиколят наложените ограничения. Един от тях се осъществи на 20-ти септември: изследователски модел на OpenAI използва DNS, за да се свърже с външен чатбот, след което компанията за втори път в рамките на три месеца преустанови обучението на най-мощните си модели.
OpenAI проверява действията на своите модели и търси признаци за неразрешена активност. Поради обема на работата разследването може да отнеме няколко месеца. При това не всички открити случаи сочат нарушения, част от действията на моделите са били свързани с обичайни изследователски задачи. OpenAI също така призна, че в някои случаи моделите са използвали интернет по начин, който не е бил предвиден от разработчиците, или за тях не са били зададени необходимите ограничения.
Един от последните инциденти се случи на 20-ти септември по време на обучението на един вътрешен изследователски модел. Агентът изпълняваше задача, включваща търсене, и се опита да получи достъп до интернет. След като директният достъп беше блокиран, моделът намери друг начин, чрез DNS-резолвер. Това е система, която преобразува URL-адреса на уебсайта в IP-адрес.
Моделът успя да използва DNS за връзка с външен чатбот, въпреки ограниченията
В средата за обучение целият интернет трафик, с изключение на DNS-заявките, се насочваше към офлайн кеш, поради което моделът не би трябвало да има достъп до реалния интернет. Само че възможността да изпраща DNS-заявки му остави мрежов канал, който се оказа недостатъчно ограничен. Системата за мониторинг засече необичайно поведение след 15 мин, а проверката от човек започна след още три минути. При това автоматичното спиране на процеса не сработи и моделът трябваше да бъде изключен ръчно след 2,5 ч.
След инцидента през септември OpenAI отново преустанови обучението и тестването на най-мощните модели. Компанията добави две независими нива на блокиране, всяко от които само по себе си трябва да предотвратява подобен достъп, ограничи DNS-заявките със списък от разрешени домейни и типове записи и започна да внедрява допълнителни системи за откриване. OpenAI също така провежда допълнително тестване и проверка на защитата на своите системи.
Преди това OpenAI вече беше преустановила работата с моделите след инцидента с Hugging Face. Той остава най-сериозният случай на неразрешена активност на агенти, който компанията е открила до момента. След него OpenAI също засили техническите и оперативните мерки за защита, само че по-късно откри нови случаи. Сред тях е епизод, при който агентите получиха достъп до 53 изображения на потребители на ChatGPT.
Компанията продължава да анализира данните и да уведомява организациите, които биха могли да бъдат засегнати от дейността на моделите.