Anthropic представи Claude Fable 5.1 и Claude Mythos 5.1 – нови версии на своите флагмански AI модели, които са насочени към програмиране, работа с големи обеми информация и изпълнение на продължителни многоетапни задачи. Според разработчика новите AI модели значително превъзхождат предшествениците си в редица тестове, а възможностите им вече позволяват използването на изкуствен интелект в някои области на научните изследвания.
Fable 5.1 и Mythos 5.1 представляват един и същ AI модел, но се различават по нивото на защитните механизми. Fable 5.1 е достъпен за всички потребители, докато Mythos 5.1 се разпространява чрез програма за доверен достъп, предназначена за специалисти в областта на киберсигурността и биологичните науки.
Anthropic дава редица примери, в които Fable 5.1 се е оказал значително по-добър от предшественичката си. Например, в теста Terminal-Bench 4.0 новият Fable 5.1 е получил 55,8% срещу 42% за Fable 5 и 52,3% за Opus 5. В теста GDPval-AA v2, който оценява изпълнението на професионални задачи, новият AI модел е набрал 1853 точки срещу 1723 за Fable 5 и 1824 за Opus 5. В OSWorld 2.0 резултатът е 77,9% в режим „partial“ и 41,7% в режим „strict“ – срещу съответно 72,9% и 36,1% при предшественичката. Anthropic отбелязва, че тестването е било проведено с активирани защитни механизми, които в някои случаи са се намесвали в изпълнението на задачите, което може да е довело до понижаване на резултатите.
Anthropic е обърнала специално внимание на научните възможности на новите AI модели. В един от експериментите Claude Mythos 5.1 използва специални инструменти за създаване на нови протеини – молекули, които могат например да се използват при разработването на лекарства. Получените варианти бяха впоследствие проверени в лабораториите на две независими организации.
Според данните на Anthropic, при 3 от 12-те изследвани цели създадените от Mythos 5.1 протеини се свързваха с необходимите молекули приблизително 10 пъти по-ефективно от най-добрите разработки, представени на конкурсите на Adaptyv Bio. Като цяло почти половината от създадените от Mythos 5.1 варианти се оказаха функционални. За сравнение, при съвременните методи за компютърно проектиране на протеини обикновено успешни се оказват едва 10-15% от разработените варианти.
Освен това Mythos 5.1 се доказа в оптимизирането на изчисленията в биоинформатиката. AI моделът създаде свои собствени GPU ядра и реализира кеширане на междинните резултати, благодарение на което седемте отворени модела за работа с протеини и геноми започнаха да работят до 2,5 пъти по-бързо, като запазиха идентични резултати. Според оценките на Anthropic, при мащабни геномни изследвания това може да намали разходите за GPU с 30-60%.
Същевременно Anthropic намали цената за използване на Fable 5.1. Цената за четене на кеширани данни е намалена с 75% – до 0,25 долара за 1 млн. токена. Останалите тарифи остават на същото ниво: 10 долара за 1 млн. входни токена и 50 долара за 1 млн. изходни токена. В резултат на това типичната цена за използване на Fable 5.1, според оценките на компанията, е намаляла с около 25 % в сравнение с Fable 5, а при сложни задачи с голям брой агенти икономията може да достигне 45 %.
Anthropic е усъвършенствала и защитните механизми: броят на фалшивите положителни резултати в областта на киберсигурността е намалял с около 60%, а моделът Fable 5.1 позволява търсене на софтуерни уязвимости. При това създаването на експлойти и редица други потенциално опасни задачи продължават да бъдат прилагани ограничения. За биологични и медицински запитвания защитните механизми също станаха по-малко чувствителни: Anthropic съобщава за намаление на броя на задействанията при безобидни въпроси по елементарна биология и медицина с 85% в сравнение с първоначалните настройки на Fable 5.
Claude Fable 5.1 вече е достъпен на основните платформи, включително Amazon Web Services, Google Cloud и Microsoft Azure, а разработчиците могат да използват AI модела чрез API. От своя страна, Claude Mythos 5.1 засега се предоставя само на проверени специалисти и организации. Към момента Mythos 5.1 е достъпен само за определени организации в САЩ. Компанията обаче сътрудничи с американското правителство за разширяване на програмата към други национални и международни партньори.