Китайската компания Moonshot изпълни обещанието си и публикува безплатно теглата на революционния си AI модел Kimi-K3. Сега всеки, който разполага с достатъчно мощни изчислителни ресурси може да го стартира на своето собствено оборудване.

На практика се потвърди, че Kimi-K3 значително превъзхожда моделите GPT на OpenAI и Claude на Anthropic от предишните поколения и отстъпва само малко на водещите Sol и Fable.

Освен това, експлоатацията на китайския AI модел струва 2-3 пъти по-малко от тази на американските аналози, а ако заявката попадне в кеша – дори 10 пъти по-малко. За въвеждане на данни в собствените си ресурси Moonshot AI таксува 3 долара за 1 млн. токена. За сравнение, при Anthropic Fable цената е 10 долара, а при OpenAI GPT-5.6 Sol – 5 долара. И това важи за входни данни, които не са кеширани, а механизмите за кеширане на Kimi-K3 осигуряват 90% покритие за задачи по писане на код и 3 долара се превръщат в 0,30 долара за същите 1 млн. токена. Подобна е ситуацията и с изходните токени.

Най-вероятно разработчиците са постигнали такава ефективност, благодарение на комбинацията от числовия формат MXFP4 за съхранение на теглата и MXFP8 за активиране на входните данни – и в двата случая точността е относително ниска, което спомага за икономия на памет. От всичките 2,8 трилиона параметри на Kimi-K3 едновременно са активни само 104,2 милиарда. Интересно е, че в описанието се споменава работата на AI модела само на относително скромни AI ускорители Nvidia H20, които нямат вградена поддръжка на MX с плаваща запетая, за разлика от AI ускорителите от серията Blackwell, които не се доставят в Китай. Това означава, че Kimi-K3 е оптимизиран за работа на по-малко мощно оборудване, а стартирането му на най-модерните AI ускорители на Blackwell или други AI ускорители с поддръжка на MXFP може да го направи по-икономичен, но това все още не е потвърдено с официални данни.

Освен това Kimi-K3 не използва key-value (KV) хранилище, а вместо това предлага обработка на състояния с фиксиран размер Kimi Delta Attention, който на теория обещава да спести видеопамет и да съкрати времето за изпълнение. Алгоритъмът MoE (Mixture-of-Experts) предполага стартирането само на 16 от 896 „експерти“, което допълнително допринася за намаляване на разходите за извеждане. Струва си обаче да се отбележи, че отворените тегла не означават отворен изходен код: процесът на обучение и наборът от данни Moonshot се пазят в тайна.