NVIDIA випустила Nemotron 3 Diarization для розділення восьми мовців у реальному часі
NVIDIA випустила відкриту 100M-модель Nemotron 3 Diarization, що розділяє до восьми мовців навіть за одночасного говоріння. Вона досягає похибки 14,72% DER на бенчмарку VoiceArena і працює в потоковому режимі з буферною затримкою від 320 мілісекунд.

Вплив: Середній
Чому це важливо
Додайте локальну атрибуцію реплік мовців у потокову транскрипцію нарад і голосові агенти без передавання чутливих аудіопотоків стороннім хмарним провайдерам.
TL;DR
- 01Відкрита 100M-модель розпізнає до восьми одночасних мовців із показником похибки 14,72% DER.
- 02Кеш AOSC зберігає ідентифікатори мовців у потоці без ресурсомісткого повторного обчислення перестановок.
- 03Мінімальний рекомендований буфер 0,32 секунди підходить для інтерактивних голосових агентів.
Ключові факти
- Кількість параметрів
- 100M параметрів (відкриті ваги)
- DER у VoiceArena Diarization-Bench
- 14,72% (комір 0 мс, 1-е місце)
- Кількість підтримуваних мовців
- До 8 мовців одночасно
- Архітектура трансформера
- 31 шар із RoPE, блоки по 80 мс
- Мінімальний рекомендований буфер
- 0,32 секунди
Атрибуція мовців у потоковому аудіо
Звичайні моделі розпізнавання мовлення (ASR) генерують суцільний текст без маркування учасників, що ламає аналіз домовленостей і роботу агентів у зустрічах із кількома людьми. Модель NVIDIA Nemotron 3 Diarization розв'язує цю проблему, пропонуючи відкриту архітектуру на 100M параметрів для детекції до восьми мовців одночасно.
У бенчмарку VoiceArena Diarization-Bench модель посіла перше місце серед 12 систем на вибірці з 139 англомовних діалогів, показавши помилку 14,72% DER без граничного коміра (boundary collar), що на 24% точніше за найближчого конкурента (19,3% DER).
Архітектура та збереження контексту мовців
Модель обробляє моноаудіо 16 кГц наступним пайплайном:
- Стек спектрограм: Генерує Mel-спектрограми з кроком 10 мс, об'єднуючи їх у блоки по 80 мс.
- Трансформер-енкодер: Включає 31 шар із позиційними ембедінгами RoPE.
- Вихідний шар: Conv1D формує тензор
[T, 8], де кожне значення відповідає ймовірності активності каналу з базовим кроком 10 мс. - Пам'ять потоку: Використовує кеш Arrival-Order Speaker Cache (AOSC) і FIFO-буфер, що фіксує черговість появи мовців і запобігає перестановці ідентифікаторів між сусідніми аудіочанками.
Конфігурація затримки буфера
Для інтеграції в реальні сервіси передбачено чотири робочі точки буферизації:
30,4 с: Максимальна точність для пакетного офлайн-аналізу записів.1,04 с: Оптимальний режим для транскрибування робочих відеодзвінків.0,64 с: Знижена затримка для моніторингу колцентрів.0,32 с: Рекомендований мінімум для потокових голосових ШІ-агентів.
Спробуй за 2 хвилини
# Basic configuration targets for Nemotron 3 Diarization latency
# Buffer latency choices: 30.4s (offline), 1.04s, 0.64s, 0.32s (streaming minimum)
config = {
"sample_rate": 16000,
"frame_step_ms": 10,
"max_speakers": 8,
"input_buffer_latency_sec": 0.32,
"memory": "AOSC_FIFO"
}python
✓ Коли використовувати
- Створення сервісів транскрибування зустрічей та інтерв'ю з кількома учасниками.
- Розробка повнодуплексних голосових агентів, які мають розпізнавати перебивання співрозмовника.
- Локальна обробка архівів розмов із частим накладанням реплік без хмарних API.
Що зробити сьогодні
- Протестуйте чекпоїнт на багатокористувацьких записах 16 кГц із буфером затримки 0,32 с або 0,64 с.
- Об'єднайте тензор міток [T, 8] із наявним пайплайном Whisper або NeMo ASR для отримання повного транскрипту.
- Зіставте анонімні канали speaker_0..speaker_7 із метаданими користувачів зустрічі.
Джерела