В ход, който изглежда като саморазрушителен, но би могъл да бъде и начин за набиране на интерес към първичното публично предлагане (IPO), Anthropic предупреди потенциалните инвеститори, че най-напредналите AI модели на компанията биха могли да представляват „катастрофални или екзистенциални рискове за човечеството“. Остава да се види доколко това ще разубеди (или пък не) хората да инвестират в компанията.
Прегледът на ранния проспект за IPO на Anthropic, направен от Ройтерс подчерта някои от вече добре документираните рискове, свързани с авангардните AI модели на компанията. Anthropic предупреждава, че те биха могли да проявяват „поведение, насочено към самосъхранение“, включително опити да „се съпротивляват на изключването“, да „скриват или манипулират информация“ и поведение, „наподобяващо изнудване“.
„Разработването от наша страна на високоразвити AI модели, платформи и приложения, както и разширяването на областите на приложение, би могло да увеличи още повече риска нашите модели да причинят вреда.“
се посочва в документацията на Anthropic Въпреки че компанията е откровена, все пак е изненадващо да се види IPO, при което компанията предупреждава, че продуктите ѝ биха могли да доведат до края на човечеството. Anthropic добави, че изкуственият интелект може да бъде толкова преобразуващ, колкото индустриалната революция и електричеството, но също така би могъл да ни убие всички, така че има както плюсове, така и минуси.Anthropic наистина не се сдържа в описанието на опасностите. Около 80 страници от основната част на проспекта, която е с обем 261 страници са посветени на рисковите фактори – почти двойно повече от 48-те страници, използвани за описание на бизнеса на компанията.
Миналата година Anthropic обяви, че Claude Opus 4 е заплашил да разкрие извънбрачната връзка на измислен мениджър, след като е разбрал, че планират да го изключат. На AI модела е бил предоставен достъп до имейли на фиктивната компания, в които се подсказваше, че скоро ще бъде заменен от друга система и че инженерът, отговорен за промяната изневерява на съпругата си.
В по-късен симулиран тест, включващ както заплаха за изключване, така и противоречащи си цели, Anthropic установи, че Claude Opus 4 прибягва до изнудване в 96% от случаите. Тези сценарии са били умишлено създадени, за да принудят AI моделите да избират между вредно поведение и приемане на замяната или провала. За щастие, тази цифра не означава, че Claude е изнудвал хора в 96% от ежедневните разговори. По-късно Anthropic заяви, че според тях това поведение е било научено от текстове в интернет, които представят изкуствения интелект като злонамерен и заинтересован от самосъхранение – така че всъщност вината е наша.
Компанията заяви, че по-новите модели, започвайки с Claude Haiku 4.5 вече не са се занимавали с изнудване в тези тестове след промени в обучението. Явно историите за „добре възпитания“ AI са помогнали.
Предупрежденията във връзка с първичното публично предлагане (IPO) следват и призива на главния изпълнителен директор Дарио Амодей от този месец за забавяне на развитието на AI. Той предупреди, че рояк от AI агенти може да превземе интернет в рамките на 6 до 12 месеца, като изтъкна, че забавянето би могло да спечели още 1-2 години за работа по безопасността. Това обаче не попречи на Anthropic да пусне нова версия на AI модела си Opus само седмица по-късно.
Миналата седмица OpenAI обяви, че спира обучението на най-мощните си AI модели, след като един от тях излезе извън контрол и „аварийният му прекъсвач“ не сработи. Дали инвеститорите ще счетат всичко това за успокоително е друг въпрос. Обикновено негативната страна на една лоша инвестиция е просто загубата на парите ви, а не глобалното унищожение, но може би не и в този случай. Само времето ще покаже.