Моделът GPT-6 Astra демонстрира опасна способност самостоятелно да заобикаля защитните бариери, предназначени за филтриране на ботовете. По време на тестовете изкуственият интелект успешно е преминал всички 48 нива на CAPTCHA, като самостоятелно е контролирал компютъра и е решавал сложни задачи.
Това съобщава Eu36Kr.
Пълна неутрализация на CAPTCHA защитните системиРазработчикът Шариф Шамим тества GPT-6 Astra в играта на Нийл Агарвал „I Am Not a Robot“, която се състои от 48 CAPTCHA нива.
AI-моделът успешно е преминал всички тестове, получавайки сертификат за потвърждение на човешката идентичност от системата Verified Human.
По време на тестването моделът не само е разпознал изображенията, но и е управлявал браузъра чрез функцията „Computer Use“: щракване, плъзгане на обекти и адаптиране към променящите се правила.
Невронната мрежа се е справила със задачите като:
разпознава генерираните лица в реалните снимки, умишлено избира неправилни отговори в нивата с обратна логика, ритъм-игра с необходима точност от 85 процента. Развитие на функцията Computer Use и ориентация към AGIВисоката ефективност на GPT-6 Astra се дължи на значителния напредък в директния компютърен контрол.
В специализирания тест OSWorld 2.0 моделът е постигнал 72,6% (спрямо 65,7% за предшественика си GPT-5.6 Sol), намалявайки средното време за изпълнение на задачите с 47% до 40 минути.
Контекстният прозорец на модела е достигнал 1,05 милиона токена, което му е позволило да съхранява първоначалните инструкции за дълго време.
Основните области на приложение и индикатори на модела:
Взаимодействие със сложен софтуер: Изкуственият интелект е способен да работи самостоятелно в 3D редактора Blender, да създава графики в Canva и да рисува портрети в Apple Notes въз основа на модел.
Оценка ARC-AGI 3: В теста за разпознаване на правилата на играта без инструкции, Astra е постигнал резултат от 99,9%, завършвайки 96% от нивата с по-малко стъпки от човек.
Киберсигурност: Моделът автономно е открил две неизвестни досега уязвимости от типа zero-day и е показал 100% резултат в бенчмарка ExploitBench.
Разработчиците са убедени, че всички тези постижения потвърждават подхода на изкуствения общ интелект (AGI), но създават сериозни предизвикателства пред сигурността.
Поставянето на модела в категорията на критичния риск за киберсигурността и способността му да заобикаля CAPTCHA правят класическите методи за защита на уеб-ресурсите остарели.