Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. Google представила моделі Gemini 3.8 Live та Extended Thinking для живого діалогу
Моделі й дослідження

Google представила моделі Gemini 3.8 Live та Extended Thinking для живого діалогу

Google випустила Gemini 3.8 Live та Gemini 3.8 Live Extended Thinking з підтримкою паралельних міркувань у реальному часі та фонового виклику інструментів без пауз у розмові. Розробники можуть створювати голосових агентів через Gemini API, Google AI Studio та платформи штибу LiveKit чи Pipecat.

17 вересня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 17 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Google представила моделі Gemini 3.8 Live та Extended Thinking для живого діалогу

Вплив: Високий

Чому це важливо

Тепер можна викликати асинхронні інструменти просто під час голосової розмови без затримок у потоковому аудіо та очікування завершення репліки.

TL;DR

  • 01Gemini 3.8 Live виконує звернення до інструментів у фоні без зупинки голосового потоку.
  • 02Extended Thinking отримала 82.6 бала на Speech to Speech Index та 68.6% на тесті агентів τ-Voice.
  • 03Обидві моделі вже доступні в Gemini API, Google AI Studio та фреймворках LiveKit і Pipecat.

Ключові факти

Успішність завдань τ-Voice68.6% (за даними компанії)
Бенчмарк Sierra τ-Voice banking35.1% (за даними компанії)
Результат Big Bench Audio97.7% (за даними компанії)
Speech to Speech Quality Index
82.6 (1-ше місце, за даними компанії)
Успішність завдань τ-Voice
68.6% (за даними компанії)
Бенчмарк Sierra τ-Voice banking
35.1% (за даними компанії)
Результат Big Bench Audio
97.7% (за даними компанії)
Підтримувані мови
97 мов

Паралельні міркування та фонове виконання

Google представила моделі Gemini 3.8 Live та Gemini 3.8 Live Extended Thinking, головною інженерною перевагою яких є одночасна генерація мовлення та виконання фонових операцій. Замість блокування аудіопотоку під час звернення до зовнішніх інструментів, модель повідомляє користувача про початок обробки та коментує проміжні кроки без затримок.

Результати бенчмарків і мовна підтримка

За даними Google, версія 3.8 Live Extended Thinking посіла перше місце в індексі якості Speech to Speech від Artificial Analysis з результатом 82.6 бала. У тестуванні агентних сценаріїв модель показала 68.6% на τ-Voice, 35.1% на банківському бенчмарку Sierra τ-Voice та 97.7% на Big Bench Audio. Базова версія 3.8 Live забезпечує роботу з відеопотоком і автоматичне перемикання між 97 мовами прямо під час бесіди.

Доступність для розробників

Моделі вже доступні в Gemini API та Google AI Studio. Підтримка потокового медіаінтерфейсу інтегрована в платформи Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel та Vision Agents. Усе генероване аудіо захищене невидимими цифровими водяними знаками SynthID.

✓ Коли використовувати

  • Створення інтерактивної голосової підтримки з одночасним запитом до бекенду.
  • Реалізація голосових асистентів для діагностики, де користувач транслює камеру та одночасно говорить.

✕ Коли НЕ варто

  • Не використовуйте для суто текстових конвеєрів, де звичайні REST або пакетні виклики значно дешевші.
  • Уникайте в регульованих сферах із нульовою толерантністю до галюцинацій без підтвердження людиною.

Що зробити сьогодні

  • →Протестуйте сценарії голосових агентів у Google AI Studio або через Gemini API.
  • →Ознайомтеся з документацією з інтеграції аудіопотоків через LiveKit або Pipecat до Gemini 3.8 Live.

Що каже спільнота

  • “I had a funny moment with ChatGPT. I was talking to it in English and then asked it to speak Swedish with me. It did, but with an English accent. But if you just start a session in Swedish, it speaks Swedish perfectly with local accent”

    — brabel на Hacker News

  • “It is by far the least accurate of any model I have used too. For a company that was started to organize the world's information, it has by far the most misinformation I've encountered.”

    — epistasis на Hacker News

#Gemini 3.8 Live#Gemini API#Google AI Studio#LiveKit#Pipecat#SynthID

Джерела

  • Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
ПоділитисяПоділитися в XПоділитися в LinkedIn
Наступна новина →Anthropic об'єднує інтерфейс в One Claude та запускає спільні Docs і Slides

Схожі матеріали

  • Моделі й дослідженняSalesforce та NVIDIA представили модель Koa на базі Nemotron
  • Моделі й дослідженняЗовнішні підрядники читають сесії користувачів ChatGPT та приватні діалоги
  • Моделі й дослідженняДослідники виявили ін'єкції коду та крадіжку ключів у сторонніх роутерах LLM
  • Моделі й дослідженняПрактики даних OpenAI викликають занепокоєння щодо інтелектуальної власності у ChatGPT та Codex

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.