Филтрите за сигурност в търговските ИИ-модели все по-често блокират работата на специалистите по киберсигурност, които легитимно търсят уязвимости в софтуера. Системата може да откаже да анализира експлойт, дори когато изследователят действа с разрешението на собственика на продукта и се опитва да потвърди реалната опасност от открития проблем.
Разработчиците на напреднали модели са изправени пред фундаментална дилема: една и съща заявка може да служи както за защита, така и за атака. Работещ експлойт скрипт помага на инженер да тества поправка, но може също така да даде на атакуващия готов маршрут за атака. За да разреши този конфликт, Anthropic стартира Cyber Verification Program, а OpenAI пусна Trusted Access for Cyber. Верифицираните експерти получават достъп до модели с по-малко автоматични откази, въпреки че основните забрани за явно злонамерени действия остават в сила.
Програмата на OpenAI се отнася до търсенето и първоначалната оценка на уязвимостите и анализа на зловреден софтуер, обратно инженерство, откриване на атаки и тестване на кръпки. За по-рисковите операции, включително разработване на контролирани експлойти, се предоставят допълнителни разрешения за сигурност.
Но дори и след проверка, моделите се държат непоследователно, оплакват се представители на индустрията. Една и съща заявка в различни дни може да получи подробен отговор, безопасно съкратена версия или пълен отказ. Крис Анли, главен учен в NCC Group, обясни защо това е критично: Без да се опитваме да възпроизведем открития бъг, е почти невъзможно да потвърдим неговата опасност. Предполагаема уязвимост може да се окаже практически недостижима, да зависи от рядка конфигурация или да не позволи изпълнението на действието, от което се страхуват разработчиците. Ето защо офанзивното тестване е неразделна част от защитата – изследователят създава контролирана атака, за да оцени последствията от бъга, да определи спешността на поправката и след това да се увери, че актуализацията наистина блокира опасния път.
След пореден срив в облачната услуга, някои екипи преминават към отворени модели, които могат да се изпълняват локално. Техническият директор на Crowdfense, Паоло Станьо, заяви, че колегите му използват усъвършенствани облачни модели главно за обратно инженерство, докато компанията извършва търсене на уязвимости и създаване на средства за тяхната експлоатация на локални системи, така че материалите да не напускат контролираната инфраструктура. Локалното стартиране решава и проблема с поверителността: неизвестна уязвимост може да струва стотици хиляди или милиони долари, а преждевременното ѝ разкриване позволява на престъпниците да атакуват потребителите още преди пускането на кръпката.
Крис Томпсън, изпълнителен директор на RemoteThreat, смята, че подобни политики тласкат спазващите закона професионалисти към китайски отворени модели и по-специално към семейството GLM, които могат да бъдат свободно изтеглени, внедрени в собствената им мрежа и използвани без предварително одобрение от доставчика. Възниква очевиден парадокс: американските компании ограничават най-мощните си инструменти, за да затруднят атаките на нападателите, но престъпниците все още могат да се обърнат към отворени алтернативи. Защитниците, от друга страна, прекарват време в избор на формулировки, срещат непредсказуеми повреди или напълно променят платформата.
Дебатът всъщност не е за пълното премахване на ограниченията, а за това как точно трябва да се прилагат те. Изследователите предлагат разширяване на достъпа за проверени екипи, по-ясно описание на допустимите операции и реагиране на конкретни злоупотреби, вместо да се забраняват цели категории технически заявки. Цената на грешките ще се увеличи, тъй като изкуственият интелект се научи да открива уязвимости по-бързо и да изгражда вериги от атаки. Твърде свободният модел ще улесни престъпниците, докато твърде предпазливият ще остави защитниците без инструментите за тестване на същите заплахи и резултатът от тази надпревара може да зависи не само от силата на алгоритмите, но и от това кой има право да използва най-опасните им възможности и при какви условия.