Компанията за изкуствен интелект Anthropic обяви, че е блокирала опити на злонамерени лица да използват нейните модели за опасни дейности. Сред тях са кибератаки, масово наблюдение и научни изследвания, които са можели да помогнат за създаването на биологични оръжия.

С бързото развитие на изкуствения интелект и нарастването на неговите възможности, за провеждането на сложни кибератаки вече не са необходими специални технически умения. Според Anthropic днес дори отделни хора могат да създават сериозни заплахи, които допреди само една година са били напълно невъзможни. За да предотврати това, компанията е внедрила по-строги филтри и защити в най-новите си модели, ограничавайки достъпа до биологични изследвания, които биха могли да се използват с военни цели.

Новият доклад за злоупотреби с изкуствен интелект

В своя трети подробен доклад за злоупотреби с изкуствен интелект от март 2025 г. насам, Anthropic разкрива нови детайли за откритите заплахи. Докладът съдържа части от злонамерен код и конкретни примерни заявки (подкани), засечени в системата.

От компанията подчертават, че описаните случаи не са обичайни грешки или леки нарушения, а най-значимите и нови типове заплахи, установени до момента. Основната цел на публикуването им е да се подтикнат правителствата и другите разработчици на изкуствен интелект да приложат сходни мерки за защита.

„Публикуваме този доклад, защото вярваме, че имаме отговорност да разкриваме злонамерените опити за употреба на нашите услуги. С нарастването на възможностите на моделите рисковете ще се увеличават, освен ако разработчиците и защитниците на обществото не предприемат действия за тяхната сигурност“, заявяват от Anthropic.

Този обширен доклад на технологичния стартъп, който подготвя първично публично предлагане (IPO) на акциите си през есента, се появява само два дни след като един от неговите изследователи подаде оставка. Той напусна поради опасения, че Anthropic и нейните конкуренти не действат достатъчно отговорно при развитието на технологията, което създава риск тя да излезе от човешки контрол.

Опит за модифициране на опасен вирус

Между декември 2025 г. и август 2026 г. изследователите по сигурността в Anthropic са регистрирали опити за злоупотреба от най-различни субекти. Сред тях са продавачи на шпионски софтуер, политически активисти и държавно подкрепяни хакерски групи, разпространяващи пропаганда.

Един от най-сериозните случаи в доклада включва опит на неназовани лица да използват чатбота Claude при писането на кандидатстване за научно финансиране (грант). Заявката е била свързана с изследвания за „увеличаване на функцията“ (gain-of-function) – процес, при който даден организъм се модифицира генетично, за да придобие нови или по-силни свойства.

Конкретното искане е било за работа върху вируса Чикунгуня (chikungunya) – заболяване, пренасяно от комари, което причинява мъчителни болки в ставите и висока температура. Заявката е имала за цел да се създадат мутации, които да направят вируса по-лесно преносим и по-устойчив срещу имунната система.

Въпреки че подобни изследвания принципно могат да се използват за разработване на нови ваксини и методи за лечение, те крият и огромен риск. Същите познания могат да послужат за направата на по-опасен патоген за биологично оръжие. Допълнителни данни от разследването показват, че кандидатстването е било предназначено за военен изследователски институт, а потребителите са използвали посреднически мрежи, за да заобиколят регионалните ограничения на системата.

Ограничения при по-старите модели и новите защити

От Anthropic поясняват, че нито един от описаните опити за биологични изследвания не е успял да използва новите и най-мощни модели от класовете Claude Fable или Mythos. Единственото изключение при тях е свързано със случай на неразрешена дестилация – организирана кампания за тайничко извличане и копиране на възможностите на модела от чужди лаборатории.

По-старите модели, като Claude Opus 4 и Claude Sonnet 4.5 от 2025 г., са били значително под прага, при който биха могли реално да помогнат на опитен специалист да създаде биологично оръжие. Поради тази причина първоначалните защити при тях са били насочени предимно към спиране на достъпа до информация, която би помогнала на начинаещи да възпроизведат познати опасни патогени.

Днешните системи обаче са способни да изпълняват сложни научни задачи. Поради това от Anthropic признават, че вече не могат да дадат пълна гаранция, че моделите са абсолютно безопасни без допълнителни ограничения. Затова при най-новите версии, като Claude Fable 5, са внедрени много по-строги защитни филтри, които блокират широк кръг от запитвания, свързани с биологични изследвания с двойна употреба.

Бързото развитие на технологията кара много експерти да призовават правителствата да въведат държавно регулиране, вместо да разчитат само на самоконтрол от страна на компаниите. Джон Тъкстън (John Thickstun), доцент по компютърни науки в университета „Корнел“, отбелязва, че е крайно неудобно компании като Anthropic и OpenAI сами да определят кое поведение е безопасно и да взимат важни решения за цялото общество без демократичен надзор.

Дезинформация и сериозни предупреждения за бъдещето

Освен опитите за биологични изследвания, докладът описва и случаи, при които различни групи са създали стотици фалшиви профили в социалните мрежи. Тези профили са симулирали поведение на обикновени хора и са разпространявали едни и същи политически тези в продължение на цяла седмица. Установени са поне девет отделни кампании от Русия, Иран, Турция, Персийския залив, Южна Азия, Африка и Европа.

От Anthropic отбелязват важна разлика: докато платформите за социални мрежи обикновено откриват дезинформацията едва след като тя започне да се разпространява, чатботът Claude може да засече подготвянето на кампанията още докато тя се организира.

Докладът беше публикуван непосредствено след оставката на изследователя Джейкъб Коксън (Jacob Coxon). Той напусна компанията с предупреждението, че Anthropic и нейният основен конкурент OpenAI се надпреварват да създадат самоусъвършенстващ се суперинтелект, с което „рискуват живота на всички ни“. Според Коксън част от неговите колеги смятат, че изкуственият интелект може да се превърне в заплаха за съществуването на човечеството още преди края на настоящото десетилетие (до 2030 г.).

В заключение от Anthropic заявиха, че са блокирали всички установени опасни дейности, засилили са вътрешните си филтри и са споделили събраната информация с държавните органи и други компании в индустрията. Целта е да се изгради обща и по-силна защита срещу зараждащите се дигитални и биологични заплахи.