Кастомний чип OpenAI Jalapeño пройшов бенчмарки: 1400 токенів за секунду на відкритих моделях
Спеціалізований чип OpenAI Jalapeño для інференсу продемонстрував понад 700 токенів/с на DeepSeek R1 та 1400 токенів/с на GPT-OSS під час лабораторних бенчмарків. Завдяки пам'яті HBM4 він перевершує Nvidia Blackwell за виходом токенів на мегават.

Вплив: Середній
Чому це важливо
Спільна оптимізація апаратного та програмного забезпечення стрімко знижує затримку інференсу моделей міркування, забезпечуючи надшвидку роботу агентів у реальному часі.
TL;DR
- 01Чип OpenAI Jalapeño досягає від 700 до 1400 токенів/сек на відкритих моделях міркування в лабораторних тестах.
- 02Використання пам'яті HBM4 забезпечує максимум пропускної здатності на мегават енергії в умовах дефіциту потужностей дата-центрів.
- 03Поточні результати отримані на короткому контексті 8k; тестування тривалого контексту в реальних агентах ще триває.
Ключові факти
- Архітектура
- Кастомний ASIC для інференсу з пам'яттю HBM4
- Пропускна здатність DeepSeek R1
- >700 токенів/сек на користувача (Concurrency 1, за даними розробника)
- Пропускна здатність GPT-OSS / Kimi K2.5
- ~1400 токенів/сек на користувача (за даними розробника)
- Цикл розробки
- 16 місяців від збору команди до передачі на фабрику (tape-out)
- Набір бенчмарків
- InferenceX v3 (одноходова оцінка 8k1k)
Архітектура апаратного забезпечення та терміни
OpenAI у співпраці з Broadcom розпочала розробку Jalapeño у середині 2024 року, пройшовши шлях від концепту до передачі на фабрику (tape-out) приблизно за 16 місяців. Чип створено спеціально для інференсу великих мовних моделей із використанням пам'яті HBM4 для ефективної роботи з вагою моделей та KV-кешем.
Показники продуктивності інференсу
Під час лабораторних випробувань у наборі оцінок InferenceX чип Jalapeño продемонстрував наступну швидкість генерації одиночних токенів без спекулятивного декодування:
- DeepSeek R1: понад
700 токенів/сек на користувачапри одночасному запиті (concurrency 1). - GPT-OSS та Kimi-K2.5: близько
1400 токенів/сек на користувача. - Тести GSM8k: точність відповідей відповідає еталонним показникам на чипах Nvidia.
Енергоефективність та застереження
Сучасні дата-центри обмежені споживанням електроенергії, тому вихід токенів на мегават (МВт) є критичним фактором. Показники Jalapeño на МВт перевищують результати Nvidia Blackwell (GB200). Проте варто враховувати, що тести проводилися на короткому контексті (8k вхід / 1k вихід), а реальні агентські навантаження з довгим контекстом (AgentX) вимагають додаткової перевірки.
✓ Коли використовувати
- Оцінка очікуваної затримки та вартості хостингу моделей наступного покоління.
- Проектування високочастотних агентських циклів, які потребують швидкості генерації понад 1000 токенів/сек.
Що зробити сьогодні
- Стежити за майбутніми незалежними тестами AgentX для оцінки затримок при роботі з довгим контекстом на нових чипах.
- Перевірити парсери потокового виводу в додатках на здатність обробляти потік понад 1000 токенів/сек без блокування інтерфейсу.
Що каже спільнота
“... better than Blackwell in this specific case; which can also lead to OpenAI creating models that will only work on their own chips; vendor lock-in.”
“Well, with proper compaction algorithm (like in Codex), it could indeed be useful for majority of tasks even in the future.”
Джерела