Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. Кастомний чип OpenAI Jalapeño пройшов бенчмарки: 1400 токенів за секунду на відкритих моделях
Моделі й дослідження

Кастомний чип OpenAI Jalapeño пройшов бенчмарки: 1400 токенів за секунду на відкритих моделях

Спеціалізований чип OpenAI Jalapeño для інференсу продемонстрував понад 700 токенів/с на DeepSeek R1 та 1400 токенів/с на GPT-OSS під час лабораторних бенчмарків. Завдяки пам'яті HBM4 він перевершує Nvidia Blackwell за виходом токенів на мегават.

26 серпня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 26 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Кастомний чип OpenAI Jalapeño пройшов бенчмарки: 1400 токенів за секунду на відкритих моделях

Вплив: Середній

Чому це важливо

Спільна оптимізація апаратного та програмного забезпечення стрімко знижує затримку інференсу моделей міркування, забезпечуючи надшвидку роботу агентів у реальному часі.

TL;DR

  • 01Чип OpenAI Jalapeño досягає від 700 до 1400 токенів/сек на відкритих моделях міркування в лабораторних тестах.
  • 02Використання пам'яті HBM4 забезпечує максимум пропускної здатності на мегават енергії в умовах дефіциту потужностей дата-центрів.
  • 03Поточні результати отримані на короткому контексті 8k; тестування тривалого контексту в реальних агентах ще триває.

Ключові факти

Архітектура
Кастомний ASIC для інференсу з пам'яттю HBM4
Пропускна здатність DeepSeek R1
>700 токенів/сек на користувача (Concurrency 1, за даними розробника)
Пропускна здатність GPT-OSS / Kimi K2.5
~1400 токенів/сек на користувача (за даними розробника)
Цикл розробки
16 місяців від збору команди до передачі на фабрику (tape-out)
Набір бенчмарків
InferenceX v3 (одноходова оцінка 8k1k)

Архітектура апаратного забезпечення та терміни

OpenAI у співпраці з Broadcom розпочала розробку Jalapeño у середині 2024 року, пройшовши шлях від концепту до передачі на фабрику (tape-out) приблизно за 16 місяців. Чип створено спеціально для інференсу великих мовних моделей із використанням пам'яті HBM4 для ефективної роботи з вагою моделей та KV-кешем.

Показники продуктивності інференсу

Під час лабораторних випробувань у наборі оцінок InferenceX чип Jalapeño продемонстрував наступну швидкість генерації одиночних токенів без спекулятивного декодування:

  • DeepSeek R1: понад 700 токенів/сек на користувача при одночасному запиті (concurrency 1).
  • GPT-OSS та Kimi-K2.5: близько 1400 токенів/сек на користувача.
  • Тести GSM8k: точність відповідей відповідає еталонним показникам на чипах Nvidia.

Енергоефективність та застереження

Сучасні дата-центри обмежені споживанням електроенергії, тому вихід токенів на мегават (МВт) є критичним фактором. Показники Jalapeño на МВт перевищують результати Nvidia Blackwell (GB200). Проте варто враховувати, що тести проводилися на короткому контексті (8k вхід / 1k вихід), а реальні агентські навантаження з довгим контекстом (AgentX) вимагають додаткової перевірки.

✓ Коли використовувати

  • Оцінка очікуваної затримки та вартості хостингу моделей наступного покоління.
  • Проектування високочастотних агентських циклів, які потребують швидкості генерації понад 1000 токенів/сек.

Що зробити сьогодні

  • →Стежити за майбутніми незалежними тестами AgentX для оцінки затримок при роботі з довгим контекстом на нових чипах.
  • →Перевірити парсери потокового виводу в додатках на здатність обробляти потік понад 1000 токенів/сек без блокування інтерфейсу.

Що каже спільнота

  • “... better than Blackwell in this specific case; which can also lead to OpenAI creating models that will only work on their own chips; vendor lock-in.”

    — gbraad на Hacker News

  • “Well, with proper compaction algorithm (like in Codex), it could indeed be useful for majority of tasks even in the future.”

    — Marha01 на Hacker News

#DeepSeek R1#GPT-OSS#Kimi K2.5#InferenceX#Codex

Джерела

  • OpenAI Jalapeño: Better than Nvidia Blackwell
  • OpenAI: The full stack behind abundant intelligence
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаРозгортання Kimi K3 у месенджерах за допомогою пайплайнів LangBot

Схожі матеріали

  • Моделі й дослідженняЗастарілі моделі Claude уразливі до багатокрокових промпт-ін'єкцій на сторонніх API
  • Моделі й дослідженняТаємнича модель Ox Alpha з'явилася на OpenRouter, випереджаючи Fable 5 та GPT-5.6 Sol
  • Моделі й дослідженняВідкрита модель Ornith-1.5 на 397B MoE випущена під ліцензією MIT
  • Моделі й дослідженняCanonical підтримує нейросимвольне ШІ-дослідження для автоматизації перекладу C на Rust

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.