Китайската компания Alibaba представи новия си флагмански ИИ-модел Qwen3.8-Max, който, според данните на компанията, е постигнал едни от най-добрите резултати сред големите езикови модели в тестове за автономна работа, програмиране и мултимодално мислене. В редица бенчмарк тестове моделът надминава показателите на GPT-5.6 Sol Max, Claude Fable 5 и Gemini 3.1 Pro, но публикуваните резултати все още се нуждаят от независима проверка.

Едно от постиженията на Qwen3.8-Max на Alibaba е резултатът в бенчмарка OSWorld-Verified, който оценява способността на ИИ-агентите да взаимодействат с компютърни среди и да изпълняват многоетапни задачи. Моделът събра 86,1 точки и изпревари Claude Fable 5 (85,0), GPT-5.6 Sol Max (83,2) и Gemini 3.1 Pro (76,2).

Qwen3.8-Max показа високи резултати и в други специализирани тестове. В бенчмарка PaperBench, който оценява способността за анализ и възпроизвеждане на научни изследвания, моделът получи 93 точки. В TerminalBench 2.1, който проверява работата с командния ред, резултатът беше 86,6 точки. Освен това, Alibaba заяви, че моделът е лидер в тестовете Vision2Web (69,0), LVBench (81,8) и ERQA (77,8), свързани с визуален анализ, уеб задачи и мултимодално разсъждение.

Новият крал на изкуствения интелект: Qwen 3.8-Max превъзхожда GPT-5.6 Sol Max и Fable 5 в тестовете за агентски задачи Qwen3.8-Max не е тотален лидер

Въпреки това Qwen3.8-Max не се превърна в абсолютен лидер във всички категории. Например, в тестовете за разработка на софтуер SWE-Pro водещите позиции запазват решенията на OpenAI и Anthropic. Въпреки това Alibaba отбелязва, че новата модел показва „балансиран профил на производителността“: той е способен да работи с код, документи, изображения и сложни последователности от задачи.

Qwen3.8-Max е изграден върху архитектурата „Смесица от експерти“ (Mixture of Experts, MoE) и съдържа 2,4 трилиона параметри. Alibaba го позиционира не като обикновен чатбот, а като инструмент за автономно изпълнение на продължителни работни процеси — от разработката на софтуер до анализа на научни материали. Компанията твърди, че моделът е способен да изпълнява задачи, които отнемат няколко дни работа, но тези твърдения засега се основават предимно на вътрешни демонстрации.

Същевременно Alibaba обяви планове да направи публично достъпни теглата на модела заедно с по-малката версия – Qwen3.8-27B. Qwen 3.8-Max може да се превърне в един от първите флагмански модели от такова ниво, достъпни за самостоятелно внедряване. При това условията на лиценза все още не са разкрити, поради което степента на отвореност на модела остава неизвестна.

Достъпът до Qwen3.8-Max чрез API струва $2 за милион входни токени и $6 за милион изходни токени. Това прави модела по-евтин от флагманските решения на западните конкуренти. Например, обявената цена на Claude Opus 5 е около $5/$25 за милион токена, а на отделните модели на OpenAI — до $10/$60 в зависимост от режима на работа.

Ако резултатите от бенчмарковете бъдат потвърдени от независими тестове, комбинацията от високата производителност, по-ниската цена и отворените тегла може да превърне Qwen3.8-Max в сериозен конкурент на собствените модели на OpenAI, Anthropic и Google в корпоративния сегмент.