Alibaba випустила модель синхронного перекладу Qwen3.8-LiveTranslate через WebSocket
Alibaba представила Qwen3.8-LiveTranslate — мультимодальну модель синхронного перекладу з середньою затримкою 2,3 секунди для 60 мов. Інженери можуть підключати її через потоковий WebSocket API з підтримкою розпізнавання дикторів.

Вплив: Середній
Чому це важливо
Тепер можна інтегрувати двосторонній переклад аудіо та відео в агентні пайплайни з передбачуваною вартістю токенів і затримкою менше 2,5 секунд.
TL;DR
- 01Скорочує затримку синхронного перекладу мови до 2,3 секунди завдяки архітектурі Interleave.
- 02Підтримує 60 вхідних мов і синтезує мовлення для 29 мов через WebSocket Realtime API.
- 03Споживає 7 вхідних та 12,5 вихідних токенів за секунду, забезпечуючи вартість близько $1,54 за годину діалогу.
Ключові факти
- Середня затримка (LAAL)
- 2,3 секунди (за даними вендора, попередньо 2,8 с)
- Мовне покриття
- 60 мов розуміння, 29 мов синтезу мовлення
- Контекстне вікно
- 53 248 токенів (49 152 вхід / 4 096 вихід)
- Витрата токенів
- 7 токенів/с на аудіовхід, 12,5 токенів/с на аудіовихід
- Параметри аудіо
- Вхід 16 кГц PCM, вихід 24 кГц PCM
Архітектура та метрики затримки
Qwen3.8-LiveTranslate базується на архітектурі Interleave, яка одночасно генерує текст і звук безпосередньо під час прийому вхідного потоку. Метрика затримки LAAL знизилася з 2,8 до 2,3 секунди. Модель оперує контекстним вікном у 53 248 токенів (49 152 для вхідних даних та 4 096 для виходу), що дозволяє узгоджувати термінологію та імена впродовж тривалих зустрічей.
Параметри аудіо та ціноутворення
WebSocket Realtime API приймає аудіо 16 кГц PCM і повертає синтезований потік 24 кГц PCM. Вхідний аудіопотік споживає 7 токенів за секунду, а вихідний — 12,5 токенів за секунду. Година безперервного двостороннього аудіоперекладу в регіоні Сінгапур коштує близько $1,54 без урахування текстових чи графічних токенів.
Мультимодальність і диктори
Модель підтримує відеопотік до 2 кадрів/с для зчитування артикуляції та тексту на екрані. Вбудована діарізація автоматично визначає зміну спікерів і підтримує режим always для динамічного клонування тембру голосу кожного учасника. Для рідкісних термінів передбачено конфігурацію до 1000 фіксованих відповідностей (hotwords).
Спробуй за 2 хвилини
{
"model": "qwen3.8-livetranslate-flash-realtime",
"turn_detection": {
"type": "speaker_detection"
},
"session": {
"output_modalities": ["text", "audio"]
}
}json
✓ Коли використовувати
- Синхронний переклад робочих дзвінків або розробка голосових ботів із низькою затримкою реакції.
- Мультимодальні інтерфейси, де відеопотік слайдів або жестів допомагає усувати двозначності в розмові.
✕ Коли НЕ варто
- Не використовуйте для пакетного перекладу документів, генерації структурованого JSON або виклику функцій.
- Не підходить для локального автономного розгортання, оскільки версія realtime доступна лише як хмарний API.
Що зробити сьогодні
- Підключіться до WebSocket ендпоінта за ідентифікатором моделі qwen3.8-livetranslate-flash-realtime.
- Налаштуйте вхідний формат аудіо 16 кГц PCM та обробку вихідного бінарного потоку 24 кГц PCM.
- Завжди відправляйте подію session.finish перед закриттям сокета, щоб не втратити фінальний фрагмент перекладу.
Джерела