Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Агенти й MCP/
  4. OpenAI випустила Realtime 2.1 API з керованим голосовим міркуванням
Агенти й MCP

OpenAI випустила Realtime 2.1 API з керованим голосовим міркуванням

OpenAI випустила gpt-realtime-2.1 та gpt-realtime-2.1-mini, додавши вбудоване голосове міркування та зменшивши затримку p95 на 25%. Розробники можуть налаштовувати рівень міркування для оптимізації затримок і витрат.

7 липня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 7 липня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
OpenAI випустила Realtime 2.1 API з керованим голосовим міркуванням

Вплив: Високий

Чому це важливо

Тепер ви можете створювати голосових агентів із низькою затримкою, які міркують перед відповіддю та коментують свої дії під час виклику інструментів.

TL;DR

  • 01Додавайте голосовий супровід перед викликом інструментів, щоб уникнути мовчазних пауз.
  • 02Знижуйте затримку p95 на 25% завдяки оптимізованому кешуванню контексту.
  • 03Обирайте gpt-realtime-2.1-mini, щоб скоротити витрати на аудіовивід утричі порівняно з повною версією.

Ключові факти

Тариф аудіовиводу gpt-realtime-2.1-mini$20.00 за 1 млн токенів
Тариф аудіовиводу gpt-realtime-2.1$64.00 за 1 млн токенів
Кешоване аудіо на вході для mini$0.30 за 1 млн токенів
Нове аудіо на вході для mini$10.00 за 1 млн токенів
Тариф аудіовиводу gpt-realtime-2.1-mini
$20.00 за 1 млн токенів
Тариф аудіовиводу gpt-realtime-2.1
$64.00 за 1 млн токенів
Зменшення затримки p95
щонайменше 25%
Кешоване аудіо на вході для mini
$0.30 за 1 млн токенів
Нове аудіо на вході для mini
$10.00 за 1 млн токенів

Інтеграція міркувань у Realtime 2.1 Mini

Модель gpt-realtime-2.1-mini — це модель міркування з низькою затримкою, розроблена для прямих інтерфейсів "голос-в-голос". Вона обробляє аудіо та текст в межах одного конвеєра, що дозволяє уникнути класичної затримки при поєднанні окремих моделей розпізнавання та синтезу мовлення. Модель підтримує виклик інструментів (функцій) із можливістю налаштування глибини міркувань.

Затримка P95 та кешування вхідних токенів

OpenAI впровадила вдосконалене кешування промптів, що знизило затримку p95 щонайменше на 25% для всіх моделей Realtime. Кешування також суттєво мінімізує операційні витрати в довгих сесіях, оскільки системний промпт кешується після першої репліки. Кешовані вхідні аудіотокени коштують $0.30 за 1 млн, тоді як звичайний аудіоввід коштує $10.00 за 1 млн. Аудіовивід для моделі mini оцінюється у $20.00 за 1 млн токенів.

Налаштування WebRTC з'єднання

Розробники можуть ініціювати аудіопотоки WebRTC безпосередньо з клієнтських браузерів. Щоб уникнути витоку ключів API, бекенд-сервер спочатку генерує тимчасовий токен через ендпоінт /v1/realtime/client_secrets. Потім цей токен передається на фронтенд для встановлення з'єднання PeerConnection через WebRTC.

Спробуй за 2 хвилини

const r = await fetch("https://api.openai.com/v1/realtime/client_secrets", {
  method: "POST",
  headers: {
    "Authorization": `Bearer ${process.env.OPENAI_API_KEY}`,
    "Content-Type": "application/json"
  },
  body: JSON.stringify({
    model: "gpt-realtime-2.1-mini",
    instructions: "You are a support agent. Reply in one or two short sentences."
  })
});
const { value: EPHEMERAL_KEY } = await r.json();

javascript

✓ Коли використовувати

  • Створення розмовних голосових асистентів, що вимагають багатокрокових викликів інструментів.
  • Розгортання голосових застосунків із низькою затримкою через WebRTC на мобільних чи веб-платформах.

✕ Коли НЕ варто

  • Звичайні текстові агенти, де простіші та дешевші Chat Completion API є економічно вигіднішими.
  • Проекти з жорсткими бюджетами, де голосові API все ще залишаються занадто дорогими.

Що зробити сьогодні

  • →Переведіть існуючі проекти з realtime-mini на gpt-realtime-2.1-mini.
  • →Встановіть параметр reasoning_effort на значення 'low' за замовчуванням для розмовних систем.
  • →Впровадьте оптимізацію кешування токенів, щоб скористатися тарифом $0.30/1М.
#OpenAI Realtime API#WebRTC

Джерела

  • OpenAI Releases New Realtime Voice Models with Reasoning and Lower Latency
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаNVIDIA Nonuniform Tensor Parallelism захищає навчання великих мовних моделей від збоїв GPUНаступна новина →NVIDIA випустила модель Nemotron Labs 3 Puzzle 75B Latent Mixture of Experts

Схожі матеріали

  • Агенти й MCPAnthropic презентувала Model Hardware Standard для керування пристроями через AI-агентів
  • Агенти й MCPКомпакція контексту видаляє інструкції: уроки інциденту з очищенням пошти в OpenClaw
  • Агенти й MCPБезголовий браузер на Rust без Chromium для штучного інтелекту
  • Агенти й MCPПакет Awesome GPT-Image-2 додає AI Agent Skills до Claude Code та Cursor

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.