Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. NVIDIA випустила Nemotron 3 Diarization для розділення восьми мовців у реальному часі
Моделі й дослідження

NVIDIA випустила Nemotron 3 Diarization для розділення восьми мовців у реальному часі

NVIDIA випустила відкриту 100M-модель Nemotron 3 Diarization, що розділяє до восьми мовців навіть за одночасного говоріння. Вона досягає похибки 14,72% DER на бенчмарку VoiceArena і працює в потоковому режимі з буферною затримкою від 320 мілісекунд.

23 вересня 2026 р.· 6 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 23 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
NVIDIA випустила Nemotron 3 Diarization для розділення восьми мовців у реальному часі

Вплив: Середній

Чому це важливо

Додайте локальну атрибуцію реплік мовців у потокову транскрипцію нарад і голосові агенти без передавання чутливих аудіопотоків стороннім хмарним провайдерам.

TL;DR

  • 01Відкрита 100M-модель розпізнає до восьми одночасних мовців із показником похибки 14,72% DER.
  • 02Кеш AOSC зберігає ідентифікатори мовців у потоці без ресурсомісткого повторного обчислення перестановок.
  • 03Мінімальний рекомендований буфер 0,32 секунди підходить для інтерактивних голосових агентів.

Ключові факти

Кількість параметрів100M параметрів (відкриті ваги)
Кількість підтримуваних мовцівДо 8 мовців одночасно
Кількість параметрів
100M параметрів (відкриті ваги)
DER у VoiceArena Diarization-Bench
14,72% (комір 0 мс, 1-е місце)
Кількість підтримуваних мовців
До 8 мовців одночасно
Архітектура трансформера
31 шар із RoPE, блоки по 80 мс
Мінімальний рекомендований буфер
0,32 секунди

Атрибуція мовців у потоковому аудіо

Звичайні моделі розпізнавання мовлення (ASR) генерують суцільний текст без маркування учасників, що ламає аналіз домовленостей і роботу агентів у зустрічах із кількома людьми. Модель NVIDIA Nemotron 3 Diarization розв'язує цю проблему, пропонуючи відкриту архітектуру на 100M параметрів для детекції до восьми мовців одночасно.

У бенчмарку VoiceArena Diarization-Bench модель посіла перше місце серед 12 систем на вибірці з 139 англомовних діалогів, показавши помилку 14,72% DER без граничного коміра (boundary collar), що на 24% точніше за найближчого конкурента (19,3% DER).

Архітектура та збереження контексту мовців

Модель обробляє моноаудіо 16 кГц наступним пайплайном:

  • Стек спектрограм: Генерує Mel-спектрограми з кроком 10 мс, об'єднуючи їх у блоки по 80 мс.
  • Трансформер-енкодер: Включає 31 шар із позиційними ембедінгами RoPE.
  • Вихідний шар: Conv1D формує тензор [T, 8], де кожне значення відповідає ймовірності активності каналу з базовим кроком 10 мс.
  • Пам'ять потоку: Використовує кеш Arrival-Order Speaker Cache (AOSC) і FIFO-буфер, що фіксує черговість появи мовців і запобігає перестановці ідентифікаторів між сусідніми аудіочанками.

Конфігурація затримки буфера

Для інтеграції в реальні сервіси передбачено чотири робочі точки буферизації:

  • 30,4 с: Максимальна точність для пакетного офлайн-аналізу записів.
  • 1,04 с: Оптимальний режим для транскрибування робочих відеодзвінків.
  • 0,64 с: Знижена затримка для моніторингу колцентрів.
  • 0,32 с: Рекомендований мінімум для потокових голосових ШІ-агентів.

Спробуй за 2 хвилини

# Basic configuration targets for Nemotron 3 Diarization latency
# Buffer latency choices: 30.4s (offline), 1.04s, 0.64s, 0.32s (streaming minimum)
config = {
    "sample_rate": 16000,
    "frame_step_ms": 10,
    "max_speakers": 8,
    "input_buffer_latency_sec": 0.32,
    "memory": "AOSC_FIFO"
}

python

✓ Коли використовувати

  • Створення сервісів транскрибування зустрічей та інтерв'ю з кількома учасниками.
  • Розробка повнодуплексних голосових агентів, які мають розпізнавати перебивання співрозмовника.
  • Локальна обробка архівів розмов із частим накладанням реплік без хмарних API.

Що зробити сьогодні

  • →Протестуйте чекпоїнт на багатокористувацьких записах 16 кГц із буфером затримки 0,32 с або 0,64 с.
  • →Об'єднайте тензор міток [T, 8] із наявним пайплайном Whisper або NeMo ASR для отримання повного транскрипту.
  • →Зіставте анонімні канали speaker_0..speaker_7 із метаданими користувачів зустрічі.
#NVIDIA Nemotron 3 Diarization#NVIDIA Streaming Sortformer#NeMo

Джерела

  • Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаІзоляція MCP-серверів інструментів для багатоканальних та мультиорендних агентівНаступна новина →Підтримка AGENTS.md у Claude Code непомітно вимикається за відсутності телеметрії

Схожі матеріали

  • Моделі й дослідженняStepFun Step 5 Preview: 600B MoE модель для агентів із підтримкою Claude Code
  • Моделі й дослідженняAlibaba випустила модель синхронного перекладу Qwen3.8-LiveTranslate через WebSocket
  • Моделі й дослідженняGoogle представила моделі Gemini 3.8 Live та Extended Thinking для живого діалогу
  • Моделі й дослідженняSalesforce та NVIDIA представили модель Koa на базі Nemotron

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.