NVIDIA представи отворения модел Nemotron 3.5 Lightning с 30 милиарда параметъра, създаден за ускоряване на работата на ИИ-агентите. Новият модел се позиционира като икономично решение за рутинни задачи, програмиране и извикване на инструменти — в комбинация с по-мощни модели и система за маршрутизация. Според компанията този модел изпълнява агентските сценарии до четири пъти по-бързо от аналозите си и може да работи на локални графични процесори от нивото на GeForce RTX 5090.
Nemotron 3.5 Lightning принадлежи към архитектурата Mixture of Experts (MoE) и има 30 млрд. параметри, от които за обработката на всеки токен се активират 3 млрд. Този подход позволява да се намалят изчислителните разходи в сравнение с пълноразмерните модели. NVIDIA заявява, че моделът може да работи на един GPU и е предназначен за агентски задачи, от извикване на инструменти и писане на код до обработка на голям брой рутинни операции.
NVIDIA предлага Lightning да се използва не като заместител на най-мощните модели, а като част от система, състояща се от няколко модела. В такава архитектура сложните модели ще отговарят за планирането и вземането на решения, а по-компактният Lightning — за изпълнението на голям брой прости операции. За автоматичното разпределение на задачите компанията представи маршрутизатора NVIDIA NeMo Switchyard. Тази система определя кой модел е по-подходящ за конкретното запитване, като насочва сложните задачи към по-мощните модели, а рутинните — към Lightning.
Архитектурни иновации и светкавична скоростNVIDIA е обърнала специално внимание на скоростта на работа. В теста PinchBench този модел Nemotron 3.5 Lightning постигна точност от 86% и изпълни 10 000 агентни задачи с 30% по-бързо от Qwen3.6 35B, при сравнимо качество. Компанията твърди, че този модел обработва задачите до четири пъти по-бързо от решенията с аналогичен размер. Тези показатели обаче са получени в тестове, проведени от самата компания, и изискват независима проверка.
Ускорението се постига, наред с другото, благодарение на спекулативно декодиране и формати на данните с ниска точност. При спекулативното декодиране специален спомагателен модел много бързо предсказва няколко следващи токена, а основният модел след това ги проверява и потвърждава или коригира. NVIDIA предлага DFlash и DSpark като спомагателни модели за различни сценарии на интерференция. Форматът NVFP4 позволява обработка на данни с по-ниска точност, спестявайки изчислителни ресурси и памет, а BF16 осигурява компромис между скорост и точност.
Оптимизация за графичните ускорители от последно поколение
Моделът може да работи както в центрове за данни, така и на локални системи, включително DGX Spark, Jetson и GeForce RTX 5090. Той може да бъде дообучен за конкретни задачи — NVIDIA публикува теглата, данните за обучение и инструкциите за настройка. В комплекта са включени отвореният наборът от данни Nemotron-RL Agentic Terminal Pivot, предназначен за обучение на агентски сценарии, включително програмиране.
Тази версия се вписва в по-широката стратегия на NVIDIA за разработване на отворени модели за изкуствен интелект. Компанията се стреми да се конкурира не само със затворени системи като OpenAI и Anthropic, но и с отворените китайски модели Qwen, DeepSeek и Kimi.
Следващото голямо пускане на пазара се очаква да бъде Nemotron 4: според данни на Reuters, NVIDIA разработва модел с повече от трилион параметри и планира да го пусне до края на есента.
NVIDIA на практика изгражда екосистема, в която собствените ѝ модели, инструменти за маршрутизация и софтуер стимулират използването на нейното оборудване. Nemotron 3.5 Lightning е достъпна за изтегляне чрез Hugging Face и ModelScope, както и за тестване чрез услугите на NVIDIA и OpenRouter.