Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. Alibaba випустила модель синхронного перекладу Qwen3.8-LiveTranslate через WebSocket
Моделі й дослідження

Alibaba випустила модель синхронного перекладу Qwen3.8-LiveTranslate через WebSocket

Alibaba представила Qwen3.8-LiveTranslate — мультимодальну модель синхронного перекладу з середньою затримкою 2,3 секунди для 60 мов. Інженери можуть підключати її через потоковий WebSocket API з підтримкою розпізнавання дикторів.

20 вересня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 20 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Alibaba випустила модель синхронного перекладу Qwen3.8-LiveTranslate через WebSocket

Вплив: Середній

Чому це важливо

Тепер можна інтегрувати двосторонній переклад аудіо та відео в агентні пайплайни з передбачуваною вартістю токенів і затримкою менше 2,5 секунд.

TL;DR

  • 01Скорочує затримку синхронного перекладу мови до 2,3 секунди завдяки архітектурі Interleave.
  • 02Підтримує 60 вхідних мов і синтезує мовлення для 29 мов через WebSocket Realtime API.
  • 03Споживає 7 вхідних та 12,5 вихідних токенів за секунду, забезпечуючи вартість близько $1,54 за годину діалогу.

Ключові факти

Середня затримка (LAAL)
2,3 секунди (за даними вендора, попередньо 2,8 с)
Мовне покриття
60 мов розуміння, 29 мов синтезу мовлення
Контекстне вікно
53 248 токенів (49 152 вхід / 4 096 вихід)
Витрата токенів
7 токенів/с на аудіовхід, 12,5 токенів/с на аудіовихід
Параметри аудіо
Вхід 16 кГц PCM, вихід 24 кГц PCM

Архітектура та метрики затримки

Qwen3.8-LiveTranslate базується на архітектурі Interleave, яка одночасно генерує текст і звук безпосередньо під час прийому вхідного потоку. Метрика затримки LAAL знизилася з 2,8 до 2,3 секунди. Модель оперує контекстним вікном у 53 248 токенів (49 152 для вхідних даних та 4 096 для виходу), що дозволяє узгоджувати термінологію та імена впродовж тривалих зустрічей.

Параметри аудіо та ціноутворення

WebSocket Realtime API приймає аудіо 16 кГц PCM і повертає синтезований потік 24 кГц PCM. Вхідний аудіопотік споживає 7 токенів за секунду, а вихідний — 12,5 токенів за секунду. Година безперервного двостороннього аудіоперекладу в регіоні Сінгапур коштує близько $1,54 без урахування текстових чи графічних токенів.

Мультимодальність і диктори

Модель підтримує відеопотік до 2 кадрів/с для зчитування артикуляції та тексту на екрані. Вбудована діарізація автоматично визначає зміну спікерів і підтримує режим always для динамічного клонування тембру голосу кожного учасника. Для рідкісних термінів передбачено конфігурацію до 1000 фіксованих відповідностей (hotwords).

Спробуй за 2 хвилини

{
  "model": "qwen3.8-livetranslate-flash-realtime",
  "turn_detection": {
    "type": "speaker_detection"
  },
  "session": {
    "output_modalities": ["text", "audio"]
  }
}

json

✓ Коли використовувати

  • Синхронний переклад робочих дзвінків або розробка голосових ботів із низькою затримкою реакції.
  • Мультимодальні інтерфейси, де відеопотік слайдів або жестів допомагає усувати двозначності в розмові.

✕ Коли НЕ варто

  • Не використовуйте для пакетного перекладу документів, генерації структурованого JSON або виклику функцій.
  • Не підходить для локального автономного розгортання, оскільки версія realtime доступна лише як хмарний API.

Що зробити сьогодні

  • →Підключіться до WebSocket ендпоінта за ідентифікатором моделі qwen3.8-livetranslate-flash-realtime.
  • →Налаштуйте вхідний формат аудіо 16 кГц PCM та обробку вихідного бінарного потоку 24 кГц PCM.
  • →Завжди відправляйте подію session.finish перед закриттям сокета, щоб не втратити фінальний фрагмент перекладу.
#Qwen3.8-LiveTranslate#Alibaba Cloud#QwenCloud

Джерела

  • Alibaba Releases Qwen3.8-LiveTranslate Real-Time Interpreter
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаБагаторівнева стратегія контролю якості коду для ШІ-агентівНаступна новина →Pirate Face дублює моделі Hugging Face через торенти з перевіркою контрольних сум

Схожі матеріали

  • Моделі й дослідженняGoogle представила моделі Gemini 3.8 Live та Extended Thinking для живого діалогу
  • Моделі й дослідженняSalesforce та NVIDIA представили модель Koa на базі Nemotron
  • Моделі й дослідженняЗовнішні підрядники читають сесії користувачів ChatGPT та приватні діалоги
  • Моделі й дослідженняДослідники виявили ін'єкції коду та крадіжку ключів у сторонніх роутерах LLM

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.