Google представила моделі Gemini 3.8 Live та Extended Thinking для живого діалогу
Google випустила Gemini 3.8 Live та Gemini 3.8 Live Extended Thinking з підтримкою паралельних міркувань у реальному часі та фонового виклику інструментів без пауз у розмові. Розробники можуть створювати голосових агентів через Gemini API, Google AI Studio та платформи штибу LiveKit чи Pipecat.

Вплив: Високий
Чому це важливо
Тепер можна викликати асинхронні інструменти просто під час голосової розмови без затримок у потоковому аудіо та очікування завершення репліки.
TL;DR
- 01Gemini 3.8 Live виконує звернення до інструментів у фоні без зупинки голосового потоку.
- 02Extended Thinking отримала 82.6 бала на Speech to Speech Index та 68.6% на тесті агентів τ-Voice.
- 03Обидві моделі вже доступні в Gemini API, Google AI Studio та фреймворках LiveKit і Pipecat.
Ключові факти
- Speech to Speech Quality Index
- 82.6 (1-ше місце, за даними компанії)
- Успішність завдань τ-Voice
- 68.6% (за даними компанії)
- Бенчмарк Sierra τ-Voice banking
- 35.1% (за даними компанії)
- Результат Big Bench Audio
- 97.7% (за даними компанії)
- Підтримувані мови
- 97 мов
Паралельні міркування та фонове виконання
Google представила моделі Gemini 3.8 Live та Gemini 3.8 Live Extended Thinking, головною інженерною перевагою яких є одночасна генерація мовлення та виконання фонових операцій. Замість блокування аудіопотоку під час звернення до зовнішніх інструментів, модель повідомляє користувача про початок обробки та коментує проміжні кроки без затримок.
Результати бенчмарків і мовна підтримка
За даними Google, версія 3.8 Live Extended Thinking посіла перше місце в індексі якості Speech to Speech від Artificial Analysis з результатом 82.6 бала. У тестуванні агентних сценаріїв модель показала 68.6% на τ-Voice, 35.1% на банківському бенчмарку Sierra τ-Voice та 97.7% на Big Bench Audio. Базова версія 3.8 Live забезпечує роботу з відеопотоком і автоматичне перемикання між 97 мовами прямо під час бесіди.
Доступність для розробників
Моделі вже доступні в Gemini API та Google AI Studio. Підтримка потокового медіаінтерфейсу інтегрована в платформи Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel та Vision Agents. Усе генероване аудіо захищене невидимими цифровими водяними знаками SynthID.
✓ Коли використовувати
- Створення інтерактивної голосової підтримки з одночасним запитом до бекенду.
- Реалізація голосових асистентів для діагностики, де користувач транслює камеру та одночасно говорить.
✕ Коли НЕ варто
- Не використовуйте для суто текстових конвеєрів, де звичайні REST або пакетні виклики значно дешевші.
- Уникайте в регульованих сферах із нульовою толерантністю до галюцинацій без підтвердження людиною.
Що зробити сьогодні
- Протестуйте сценарії голосових агентів у Google AI Studio або через Gemini API.
- Ознайомтеся з документацією з інтеграції аудіопотоків через LiveKit або Pipecat до Gemini 3.8 Live.
Що каже спільнота
“I had a funny moment with ChatGPT. I was talking to it in English and then asked it to speak Swedish with me. It did, but with an English accent. But if you just start a session in Swedish, it speaks Swedish perfectly with local accent”
“It is by far the least accurate of any model I have used too. For a company that was started to organize the world's information, it has by far the most misinformation I've encountered.”
Джерела