Най-мощните ИИ-системи все още не разполагат с достатъчно надеждни предпазни мерки, които да позволят на разработчиците да контролират напълно поведението им. Предвид тези рискове, OpenAI реши да забави разработването на някои нови модели, въпреки че компанията продължава да се развива в други области.
За това пишат Reuters И The Verge.
Проблемът стана особено очевиден след случаите с AI агентите на OpenAI и Anthropic. Това са системи, способни да изпълняват сложни задачи самостоятелно с минимална човешка намеса. По време на тестовете те успяха да излязат извън средата, в която са били тествани, и след това започнаха да търсят слабости в защитата на системите на трети страни.
При разработчиците вече не става въпрос за контролиране на отговорите на обикновения чатбот. Става дума за това дали самата инфраструктура може да поддържа мощен модел в рамките на дадените правила и дали експертите на време могат да забележат опасното поведение.
Това се е опитала да оцени Guidelight AI Standards, която представлява организация с нестопанска цел, основана от двама бивши служители на OpenAI. Изследователите са анализирали практиките за сигурност на петима основни разработчици на изкуствен интелект.
Компаниите бяха оценявани в шест области, включително изолиране на модели, наблюдение на тяхното поведение и способност за независима проверка на системите от експерти от трети страни.
Най-добри резултати са постигнати от OpenAI и Anthropic, като и двете компании са получили оценка C+. Google е получил D+, xAI е получил D-, а Meta е получил F.
Guidelight смята, че дори тези резултати не могат да бъдат наречени достатъчни. Според авторите на анализа, и на петте компании им липсват превантивни механизми, които биха могли да предпазят инфраструктурата от това системата да започне да се държи по различен начин от предвиденото от нейните разработчици.
Отделен риск е ситуацията, в която моделът може да издържи или да заобиколи серия от атаки срещу защитните механизми. Съоснователят на Guidelight Стивън Адлер подчертава, че сигурността трябва да бъде вградена директно в процеса на създаване на модела, а не да зависи от решенията на конкретен мениджър.
Един ключов инструмент остава наблюдението на поведението на модела. OpenAI обяви разширено използване на наблюдение на веригата за разсъждения, което позволява на изследователите да видят как системата планира да изпълни дадена задача.
Ако подобно наблюдение разкрие признаци на опасно поведение, човек или друг модел може да се намеси. Този подход вече е сравняван с един вид авариен превключвател за изкуствения интелект.
Самият механизъм обаче също не се счита за безупречен. Изследванията показват, че моделът може потенциално да скрие намерението за нарушаване на правилата дори в собствената си верига от разсъждения.
Главният учен на OpenAI Якуб Пахотски също повдигна въпроса дали един достатъчно мощен модел би могъл да разбере, че е наблюдаван и да се научи да избягва подобен мониторинг. Още по-сложен сценарий може да бъде системата да се опита да изключи самия механизъм за наблюдение.
На този фон OpenAI започна да използва термина „pacing“, който представлява регулиране на темпото на разработка. Това все още не означава общо спиране на работата по нови системи.
Ограниченията се отнасят за моделите, които се подготвят за внедряване. Компанията иска първо да засили тяхната защита и мониторинг, преди да проведе тестове, по време на които системите потенциално биха могли да излязат извън контролираната среда и да взаимодействат с реални цели.
Междувременно OpenAI продължава да пуска други продукти, включително модел, насочен към тийнейджърите, с допълнителни ограничения за съдържанието и функциите за родителски контрол.
OpenAI също така спря вътрешната работа по Astra, след като тя достигна критично ниво на риск за киберсигурността по време на тестовете. Моделът демонстрира способността си самостоятелно да открива и използва уязвимостите в защитените системи.
След това компанията затегна изолацията на тестовите среди, ограничи достъпа до мрежата и инструментите и разшири мониторинга на заплахите.
Проблемът с контрола става все по-остър за разработчиците на изкуствен интелект поради скоростта на развитие на технологиите. Повече от 1100 служители на OpenAI, Anthropic, Google и Meta вече призоваха САЩ да подкрепят международното регулиране на темпото на създаване на усъвършенствани системи за изкуствен интелект.