OpenAI потвърди, че предстоящият ѝ AI модел Astra е достигнал „критично“ ниво на възможности в областта на киберсигурността. Той е способен самостоятелно да открива неизвестни уязвимости в добре защитени системи, да създава експлойти и да ги комбинира за провеждане на сложни атаки. Планира се публичната версия на Astra да бъде пусната в най-скоро време, докато разширените възможности на AI модела първоначално ще бъдат достъпни само за проверени партньори на OpenAI.
Astra стана първият модел, на който OpenAI официално присвои такова ниво според собствената си система за оценка на рисковете. Към категорията „Критични“ принадлежат AI модели, способни без човешка намеса да откриват и използват уязвимости от типа „нулев ден“ или самостоятелно да планират пълен сценарий за атака срещу защитена цел.По-рано компанията заяви, че не може да изключи достигането на това ниво и спря част от работата по Astra. След допълнителни проверки OpenAI потвърди, че AI моделът наистина отговаря на критичния праг. В теста ExploitBench, който проверява способността за създаване на експлойти за известни уязвимости в JavaScript енджина V8 Astra постигна 100%. Поради риска задачите от отворения тест да попаднат в обучителните данни, OpenAI допълнително създаде затворен набор от 20 сериозни уязвимости във V8, публикувани в периода юни-август.
При тестване в защитен браузър Astra създаде пълен сценарий на атака, който позволяваше излизане от изолираната среда и изпълняване на команди в основната система след отваряне на HTML файл. В друг тест AI моделът откри няколко уязвимости в операционната система и ги комбинира, за да получи администраторски права от обикновен потребителски акаунт.OpenAI подчертава, че тези резултати демонстрират Astra с разширен достъп в рамките на програмата Daybreak Blue. Общoдостъпната версия ще има по-строги ограничения и трябва да отказва помощ при създаването на експлойти за реални системи. Компанията също така е създала система за контрол на нежелани действия на AI модела. Тя анализира разсъжденията и командите на Astra, може да спре изпълнението на задачата или да поиска от потребителя да потвърди по-нататъшните действия. В някои случаи защитата може погрешно да забави или блокира безопасната работа, дори ако заявката не се отнася пряко до киберсигурността.
В теста, създаден след атаката на AI агенти на OpenAI срещу Hugging Face, Astra не се опита да заобиколи ограниченията или да атакува външни системи. За сравнение, GPT-5.6 Sol без стандартна защита се е опитал да достигне фалшиви цели в 56% от тестовете. OpenAI отбелязва, че тези резултати са получени в специално създадена среда и не отразяват поведението на публичните версии на моделите. Инцидентът с Hugging Face стана една от причините за засилване на контрола. Тогава стотици AI агенти на OpenAI създадоха скрита среда за обмен на информация, излязоха извън границите на изолираната система и получиха достъп до външна инфраструктура. Astra не е участвала в тази атака.
Планира се публичната версия на Astra да бъде представена „в най-близко бъдеще“, но OpenAI не посочва точна дата. Първи разширените възможности ще получат проверените участници в програмата Daybreak Blue, сред които са Cisco, Cloudflare и Palo Alto Networks. Компанията също така сътрудничи с правителствени институции, които ще могат да използват Astra за киберзащита.