В июне OpenAI представила свой первый самостоятельно разработанный чип для инференса — Jalapeño. Уже в августе компания опубликовала результаты тестирования: в рамках теста InferenceX от SemiAnalysis Jalapeño показал лучшие результаты по сравнению с чипами NVIDIA (GB200/GB300). При выполнении моделей GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T пик производительности Jalapeño оказался в 1,5–1,9 раза выше, а задержка — в 1,7–3,6 раза меньше.
Особенность в том, что это первая версия ASIC от OpenAI. Обычно новым чипам требуется несколько поколений для достижения конкурентоспособности, но Jalapeño уже опережает решения NVIDIA, AMD и Google.
Ключевая причина успеха — специализация. В отличие от GPU NVIDIA, которые должны поддерживать разные задачи (обучение, инференс и высокопроизводительные вычисления), Jalapeño с самого начала ориентирован на инференс LLM. OpenAI проанализировал реальные нагрузки и выявил узкие места в процессе инференса: например, этап prefill (обработка подсказки) требует много вычислений, а этап decode (пословное генерирование ответа) часто ограничен пропускной способностью памяти.
Jalapeño спроектирован так, чтобы один чип мог справляться с разными этапами инференса и нагрузками — без жёсткого разделения на отдельные чипы для prefill или decode. OpenAI согласовал работу чипа, памяти, сети и ПО, чтобы минимизировать перемещение данных и задержки.
Кроме того, Jalapeño использует память HBM4 с пропускной способностью 15,4 ТБ/с — это особенно важно для задач, ограниченных пропускной способностью памяти. При этом сравнивать его с Blackwell стоит не только по поколениям, но и с учётом времени выхода на рынок: более корректным соперником для Jalapeño считается NVIDIA Vera Rubin (она тоже переходит на HBM4). По данным SemiAnalysis, Jalapeño по‑прежнему опережает по пропускной способности на ватт, а соотношение производительности и общей стоимости владения у обоих чипов близко.
OpenAI ускорил разработку ПО: от начального проектирования до tapeout прошло около 9 месяцев — в этом помогли ИИ‑инструменты. После выпуска чипа Codex и GPT‑Astra ускорили разработку ядер для разных моделей. Три модели, которые изначально не были в плане производства, за два месяца достигли высокой эффективности. Некоторые версии модулей GPT‑OSS attention и MoE, сгенерированные ИИ, оказались в 1,5–1,8 раза быстрее версий, написанных людьми.
При разработке Jalapeño OpenAI сотрудничал с другими компаниями: Broadcom предоставила технологии для реализации чипа, сети и подключения, Celestica участвовала в разработке печатных плат, корпусов и системной интеграции. Jalapeño демонстрирует, что компании с большим объёмом реальных AI‑нагрузок могут формировать новые конкурентные преимущества в разработке чипов — не привязываясь к собственным моделям, но используя свой опыт для определения приоритетов в проектировании оборудования. Массовое развёртывание Jalapeño запланировано на 2027 год.
