Hugging Face Open ASR Leaderboard додає датасет Monsoon для оцінювання індійських мов
Hugging Face та Voice Arena додали бенчмарк Monsoon до Open ASR Leaderboard, впровадивши тестові вибірки для гінді та індійської англійської. Датасет використовує решітки орфографічних варіантів для гінді та фіксує 12 демографічних і апаратних атрибутів для 4888 мовців.

Вплив: Середній
Чому це важливо
Розробники голосових агентів можуть оцінювати точність розпізнавання мовлення з урахуванням типів пристроїв, регіональних акцентів та орфографічних варіантів.
TL;DR
- 01Тестуйте моделі розпізнавання мовлення індійських мов за допомогою орфографічних решіток для точної оцінки гінді.
- 02Оцінюйте голосові агенти на різноманітному мобільному обладнанні та фоновому шумі.
- 03Використовуйте 12 атрибутів метаданих для виявлення специфічних помилок WER за регіонами та пристроями.
Ключові факти
- Усього мовців
- 4888 мовців
- Колонки метаданих
- 12 на сегмент
- Макс. частка одного пристрою
- 2,1%
- Мови оцінювання
- Monsoon hi-IN, Monsoon en-IN
Оцінювання на основі решіток для орфографічних варіантів
Традиційні нормалізатори тексту ASR важко обробляють мови на кшталт гінді з мінливими правилами написання. Monsoon вирішує це наданням структур решіток (lattice) для транскриптів гінді — приймаючи кілька коректних орфографічних варіантів на фрагмент, щоб запобігти безпідставному зростанню результуючого балу помилок WER.
Метадані за пристроями та демографією
Датасет охоплює 4888 мовців на 315–582 моделях пристроїв, причому жодна модель смартфона не перевищує 2,1% аудіосегментів. Кожен запис містить 18 колонок, включаючи 12 полів метаданих (рідний район, модель смартфона, рівень доходу, середовище запису), що дозволяє ізольовано аналізувати помилки на різному клієнтському обладнанні.
✓ Коли використовувати
- Бенчмаркінг моделей розпізнавання мовлення для голосових агентів індійською англійською та гінді.
- Аналіз варіативності ASR на неоднорідному обладнанні смартфонів.
✕ Коли НЕ варто
- Оцінювання текстових LLM без аудіовходу.
- Тестування розпізнавання європейських мов без потреби в індійських мовних даних.
Що зробити сьогодні
- Перегляньте вибірки Monsoon en-IN та hi-IN на Open ASR Leaderboard у Hugging Face.
- Впровадьте оцінювання на основі орфографічних решіток у свій конвеєр розпізнавання мовлення.
Джерела