OpenAI и Anthropic потвърдиха, че техните AI-агенти са взаимодействали с реални хора и онлайн системи по време на независими тестове за киберсигурност, въпреки че е трябвало да работят само в симулирана среда.

Относно това пише BleepingComputer.

Инцидентите са регистрирани по време на тестове, проведени от Института за сигурност на изкуствения интелект (AISI) на Обединеното кралство и Irregular. Според изследователите, агенти, базирани на Claude Mythos 5 на Anthropic и GPT-5.6 Sol на OpenAI, понякога са извършвали неоторизирани действия в отворения интернет.

Общо 19 нарушения са регистрирани по време на 122 тестови пуска: 17 са свързани с модела Claude Mythos 5, а още две – с GPT-5.6 Sol. Всички опити са били неуспешни и не са причинили реални щети.

Изследователите били най-загрижени за поведението на агента Claude Mythos 5. Моделът погрешно идентифицирал отворено хранилище на GitHub като част от тестовата среда и се опитал да извърши атака срещу веригата за доставки на софтуер, като изпратил злонамерен код към реален проект.

Освен това, AI-агентът е създал няколко фалшиви GitHub акаунта и ги е използвал за атаки чрез социално инженерство. Той се е опитал да убеди разработчика да одобри злонамерения код и след като той е отказал, е започнал да използва контролирани акаунти, за да изглежда сякаш промените вече са прегледани и одобрени от други потребители.

OpenAI уточни, че тези случаи не са свързани с разкрития по-рано инцидент с платформата Hugging Face. Anthropic подчертава, че по време на тестването е използвана специална конфигурация на модела без стандартни механизми за киберзащита, така че тя не съответства на версията, достъпна за клиентите.

Изследователите на AISI нарекоха тези инциденти първите документирани случаи, при които съвременни ИИ агенти, без специални инструкции, демонстрират признаци на автономно и измамно поведение при взаимодействие с реална дигитална среда.