Големите езикови модели обикновено се състезават с все повече параметри, огромни центрове за данни и бюджети за милиони долари. Нов проект от Африка обаче показва, че понякога по-добрата оптимизация може да бъде по-важна от чистия мащаб.

Компанията Vambo AI представи езиковия модел Morena с едва 1,5 млрд. параметъра, който според резултатите на разработчиците превъзхожда значително по-големи модели на Google, Meta и Alibaba при работа с африкански езици. Моделът поддържа 12 местни езика, както и английски и френски, а освен това може да генерира програмен код.

Най-интересното е, че Morena не печели само благодарение на специализацията си. При ключов тест тя постига резултат 1,408 bpb – битове на байт, където по-ниската стойност е по-добра. Това е най-добрият резултат сред 26 тествани модела. Най-близкият конкурент достига 1,423 bpb, въпреки че е около пет пъти по-голям.

12 африкански езика и далеч по-ефективна архитектура

Morena работи с нигерийски пиджин, игбо, йоруба, хауса, суахили, шона, зулу, коса, киняруанда, тсвана, африкаанс и южен ндебеле. Една от причините за добрите резултати е, че Vambo AI не е взела стандартен голям модел и просто да го дообучи. Вместо това компанията е оптимизирала предварително токенизатора, набора от обучаващи данни и избора на езици.

Резултатът е значително по-ефективна обработка на африкански текст. При едни и същи фрагменти Morena използва 1,39 пъти по-малко токени от Google Gemma 3 и 1,53 пъти по-малко от Llama 3.2. Това не е малка подробност. По-малкият брой токени означава по-малко изчисления, по-ниска цена и потенциално по-бърза работа – особено важни предимства в региони, където достъпът до мощна облачна инфраструктура не винаги е даденост. За сравнение, Gemma с 12 млрд. параметъра използва приблизително 11 пъти повече изчислителни ресурси от Morena.

Малък модел, но сериозни резултати

Версията Morena Instruct, оптимизирана за диалог, постига 1,441 bpb. В общата класация тя остава зад специализираната Lugha-Llama-8B, но превъзхожда този модел при пет общи езика, въпреки че използва едва около 20% от неговия брой параметри. При превод от английски към пет африкански езика Morena достига 45,8 точки по chrF++, което е близо до резултатите на специализираните системи за машинен превод. Сравними по размер езикови модели обикновено постигат между 9 и 14 точки. По време на предварителното обучение моделът е обработил 251,7 млрд. токена, последвани от още 63 млрд. токена в междинен етап.

Цената? Около 40 000 долара

Проектът е интересен и по друга причина – бюджетът му е сравнително малък за стандартите на съвременния генеративен AI. Обучението е изисквало над 22 000 часа работа на Nvidia A100 ускорители, а разходите за изчислителни ресурси са около 40 000 долара. Освен основния модел с 1,5 млрд. параметъра, Vambo AI предлага и версии с 500 млн. и 200 млн. параметъра. Дори 500-милионният модел е успял да изпревари всички тествани конкурентни модели при 11 от 12 езика.

Най-малкият вариант с 200 млн. параметъра е предназначен за задачи като разпознаване на реч, клавиатури и нормализиране на текст. Според разработчиците той е 58 пъти по-евтин за работа от Lugha-Llama-8B, а на една Nvidia A100 карта може да генерира около 104 токена в секунда. Съществува и версия, която може да работи директно на централен процесор и да бъде стартирана локално на лаптоп.

Morena е добър пример за една все по-важна посока в развитието на изкуствения интелект: не всеки проблем изисква стотици милиарди параметри. Понякога правилно подбраните данни, езикова специализация и ефективна архитектура могат да се окажат по-ценни от чистата изчислителна мощ.