OpenAI заяви, че първият ѝ специализиран чип за инференс, „Jalapeño“ може да осигури по-голям обем работа в областта на изкуствения интелект на ват, като същевременно намалява времето за отговор, което сочи към хардуерен дизайн, насочен към по-ефективно обработване на все по-взискателните работни натоварвания на AI моделите.

Компанията тества „Jalapeño“ с три публични модела: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. При тестовете чипът постигна от 1,5 до 1,9 пъти повече изчислителна мощност на ват при пикова производителност и 1,7 до 3,6 пъти по-ниска латентност от начало до край в сравнение със системите на Nvidia. При силно интерактивни натоварвания OpenAI посочва, че „Jalapeño“ е постигнал 2,1 до 4,1 пъти по-висока производителност.

Компанията твърди, че комбинирането на пропускателна способност и ниска латентност в една архитектура може да спомогне за намаляване на хардуера и енергията, необходими за обслужването на AI модели. Чипът е с номинална мощност 700 вата, въпреки че OpenAI посочи, че измерената му устойчива мощност е останала на ниво 550 вата или по-ниско по време на тестваните натоварвания. Компанията сравни Jalapeño с налични на пазара ускорителни системи, използвайки публичния бенчмарк InferenceX на SemiAnalysis.

Основен акцент в дизайна на „Jalapeño“ е избягването на обичайния компромис между пропускателна способност и латентност. Инференса има различни изисквания в зависимост от това, какво прави системата. Обработката на заявката на потребителя, известна като „prefill“, обикновено е изчислително интензивна, докато генерирането на отговора токен по токен, известно като „decode“ зависи в по-голяма степен от пропускателната способност на паметта.

Jalapeño е проектиран да обработва и двете фази в рамките на една и съща архитектура. От OpenAI посочват, че чипът съхранява състоянието на AI модела, включително кеша „ключ-стойност“, използван по време на генерирането, по-близо до изчислителните ресурси, които се нуждаят от него. Мрежовата му система също е интегрирана в архитектурата, за да се намали обемът на данните, които трябва да се прехвърлят между чиповете. Целта е да се ограничат закъсненията в комуникацията, които могат да принудят изчислителните ресурси да чакат данни. Този подход става особено важен за AI агентите, които могат да изпълняват последователно много стъпки на извличане на заключения. Малко закъснение във всяка стъпка може да доведе до значително удължаване на цялостното изпълнение на задачата.

OpenAI използва и свои собствени AI модели по време на разработката на чипа. Компанията заяви, че AI е помогнал на инженерите да проучат различни варианти на реализация, да съкратят циклите на проектиране и верификация и да оптимизират аритметичните схеми. Екипът премина от първоначалния дизайн до tapeout само за 9 месеца.

OpenAI планира да започне внедряването на „Jalapeño“ в своята изчислителна инфраструктура до края на годината. Компанията заяви, че чипът е първото поколение от много дълга пътна карта, като вече се разработват проекти от второ и трето поколение. По-широката цел е да се направи извличането на заключения по-бързо и по-енергийно ефективно, тъй като OpenAI разширява своята изчислителна инфраструктура и обслужва все по-мощни AI модели.