Първите бенчмаркове на собствения чип на OpenAI „Jalapeño“ показват превъзходство над Nvidia Blackwell

Изображение: Генерирано чрез Svetni.me AI
По време на престижната технологична конференция Hot Chips 2026, компанията OpenAI представи първите официални резултати от тестовете на своя първи собствен чип, разработен под кодовото име „Jalapeño“ [1]. Специализираният копроцесор за инференция е проектиран изцяло с цел ускоряване на работата на големи езикови модели (LLM) и демонстрира сериозно превъзходство по отношение на енергийната ефективност и латентността спрямо текущите пазарни лидери на Nvidia [1]. Тези данни дават нов поглед върху мащабната хардуерна стратегия на компанията, която се стреми да оптимизира своята софтуерна екосистема на всички нива на инфраструктурата [1].
Архитектура и хардуерни спецификации
„Jalapeño“ представлява специализирана интегрална схема за специфично приложение (ASIC), разработена в тясно сътрудничество с полупроводниковия гигант Broadcom [2]. Чипът се произвежда по модерния N3P технологичен процес на TSMC, което му осигурява висока плътност на транзисторите и изключително ниска консумация на енергия [2]. Важно е да се отбележи, че хардуерът е проектиран единствено за инференция (inference) — т.е. за изпълнение на вече обучени модели, а не за тяхното първоначално обучение. Чипът не е тясно специализиран за вътрешните модели на OpenAI, а функционира като универсален ускорител за езикови модели с общо предназначение.
За да се елиминира един от основните проблеми при обработката на AI модели — ограниченият пропускателен капацитет на паметта — чипът е оборудван с най-новата HBM4 памет от Samsung [2]. Тази памет предоставя колосален пропускателен капацитет от 15.4 TB/s, което позволява светкавичен достъп до параметрите на модела. В основата на изчислителната архитектура на Jalapeño лежи матричен двигател (matrix engine), използващ иновативния формат MXFP (Microscaling Formats), разработен за оптимизиране на изчисленията с плаваща запетая при ниска разрядност. По отношение на енергийните изисквания, чипът има пикова мощност от 700W, като поддържа стабилни 550W при постоянно натоварване.
Резултати от бенчмарковете в реална среда
Производителността на „Jalapeño“ е тествана с помощта на признатия в индустрията тестов пакет InferenceX, разработван от независимата анализаторска фирма SemiAnalysis [2]. Данните, предоставени от OpenAI и частично верифицирани на място в лабораториите на анализаторите, показват следните ключови резултати спрямо водещата архитектура Nvidia Blackwell:
- Енергийна ефективност: Jalapeño осигурява между 1.5x и 1.9x повече обработени токени на ват консумирана енергия при пиково натоварване.
- Латентност: Латентността от край до край (end-to-end latency) е намалена от 1.7x до 3.6x, което гарантира много по-бърз отговор на потребителските заявки.
- Интерактивни работни натоварвания: При сценарии, изискващи бърза реакция в реално време, чипът показва от 2.1x до 4.1x по-висока производителност.

Изображение: OpenAI / SemiAnalysis
Забележително е, че тези показатели са постигнати без прилагането на оптимизационни техники като спекулативно декодиране (speculative decoding) или прогнозиране на множество токени (multi-token prediction). Тъй като конкурентните платформи често разчитат на тези софтуерни похвати за постигане на високи резултати, липсата им при текущите тестове на Jalapeño показва, че чипът разполага с голям резерв за бъдещи софтуерни оптимизации, които да увеличат преднината му още повече.
Тестовете са проведени върху три представителни модела с различни размери:
- GPT-OSS 120B: Jalapeño постига скорост от приблизително 1400 токена в секунда за един потребител.
- DeepSeek R1 670B: Разработен от китайската лаборатория DeepSeek AI, моделът достига 700 токена в секунда при единична потребителска заявка.
- Kimi K2.5 1T: Огромен модел с един трилион параметри от Moonshot AI, който също демонстрира висока съвместимост с новата архитектура.
Директен сблъсък с бъдещата архитектура Nvidia Vera Rubin
Според анализа на SemiAnalysis, директното сравнение между Jalapeño и Blackwell не е напълно справедливо, тъй като Blackwell използва по-старо поколение памет. Истинският тест за възможностите на чипа на OpenAI е сравнението с предстоящата платформа Nvidia Vera Rubin, която също разчита на HBM4 памет [2].

Изображение: Генерирано чрез Svetni.me AI
Дори в този случай Jalapeño успява да победи Vera Rubin по отношение на обработените токени на мегават, въпреки че чипът на Nvidia използва усъвършенстваната технология за прогнозиране на множество токени, която липсва при Jalapeño. Все пак анализаторите посочват, че по отношение на общата цена на притежание (TCO - Total Cost of Ownership) за токен, двете платформи се очаква да бъдат приблизително изравнени.
Има обаче и някои съществени уговорки. Докато Nvidia и AMD вече публикуват официални резултати за по-нови модели като DeepSeek V4 Pro и Kimi K3, те все още не са тествани на Jalapeño. Освен това системите Rubin вече започват да се доставят към първите клиенти, докато Jalapeño в момента съществува единствено под формата на инженерни мостри.
Развитие и стратегически контекст
Проектирането на „Jalapeño“ е извършено с рекордна скорост. Пълният цикъл от концепцията до готовия чип е отнел 16 месеца, но активната фаза на проектиране на архитектурата е продължила само 9 месеца, преди проектът да бъде изпратен за производство в края на 2025 г. [1]. Интересен детайл е, че OpenAI е използвала собствените си изкуствени интелектуални модели в процеса на разработка [1]. По-старите поколения модели са помогнали за оптимизирането на хардуерния дизайн на чипа, докато по-новите и модерни модели са съкратили времето за програмиране на фърмуера и софтуерната оптимизация [1].
Този бърз цикъл на разработка кара SemiAnalysis да направи извода, че доминацията на софтуерната платформа CUDA на Nvidia вече не е толкова непревземаема. Възможността за толкова бързо адаптиране на нови модели към собствен хардуер показва, че софтуерният контрол на Nvidia може да бъде заобиколен чрез персонализиран силиций.
Финансовият директор на OpenAI, Сара Фрайър, обяснява, че Jalapeño е част от цялостна стратегия за изчислителна инфраструктура (full-stack compute strategy), при която центровете за данни, чиповете, моделите и крайните устройства работят в синхрон. Тя категорично подчертава, че Jalapeño има за цел да допълни текущите партньорства на OpenAI с Nvidia, AMD, AWS, Cerebras и CoreWeave, а не да ги замени изцяло. Светът има остра нужда от изчислителна мощ и собствените чипове са само един от инструментите за задоволяване на това търсене.
Източници: