AllenAI презентує BenchMIRT для аудиту та скорочення бенчмарків LLM
Allen Institute for AI випустив відкритий інструмент BenchMIRT, який застосовує багатовимірну теорію тестування для аналізу бенчмарків LLM. Аналіз 100 моделей та 34 000 запитань показав, що лише 10% найефективніших тестів забезпечують повну оцінку здібностей моделі.

Вплив: Середній
Чому це важливо
Команди, що тестують власні моделі, можуть скоротити час тестування та витрати на токени до 90%, прибравши малоінформативні тестові запитання.
TL;DR
- 01BenchMIRT застосовує теорію тестування для розділення сигналів логіки та безпеки в бенчмарках LLM.
- 02Набори тестів можна скоротити на 90% без втрати точності рейтингування моделей.
- 03Популярні бенчмарки на кшталт BBQ та WMDP здебільшого вимірюють загальну логіку, а не тільки безпеку.
Ключові факти
- Кількість перевірених моделей
- 100 відкритих LLM
- Проаналізовано запитань
- 34 000+ у межах 16 бенчмарків
- Скорочення тестового набору
- 10% запитань зберігають точність рейтингу
- Точність прогнозування відповідей
- 79% на нових тестових запитаннях
Психометричний аудит бенчмарків
AllenAI представила відкритий фреймворк BenchMIRT, який використовує багатовимірну теорію тестування (MIRT) для аналізу тестових запитань LLM на рівні окремих промптів. Інструмент визначає, наскільки кожне завдання допомагає відрізнити сильну модель від слабкої.
Розділення змішаних сигналів
Проаналізувавши 100 моделей на 16 бенчмарках (зокрема MMLU-Pro, GPQA, MATH, HarmBench та WildJailbreak), система виділила два незалежні вектори — безпеку та логічне мислення:
- BBQ (тест на упередженість): корелює здебільшого з логічним мисленням, а не з безпекою.
- WMDP (небезпечні знання): результати відображають загальну логіку, де сильніші моделі часто отримують нижчий бал через відмову генерувати контент.
- HarmBench: класичні запитання вимірюють безпеку, тоді як тести на авторське право — загальну ерудицію.
Скорочення обсягу тестів на 90%
Відбір 10% найбільш показових завдань дозволяє зберегти майже ідентичний рейтинг моделей. Окрім цього, статистична модель BenchMIRT передбачає відповідь моделі на нові запитання з точністю 79% (проти 70% у базових підходів).
Спробуй за 2 хвилини
git clone https://github.com/allenai/BenchMIRT
cd BenchMIRT
pip install -r requirements.txtbash
✓ Коли використовувати
- Оптимізація пайплайнів автоматичного тестування під час навчання та файнтюнінгу моделей.
- Аудит внутрішніх датасетів безпеки для усунення неінформативних або шумних тестів.
✕ Коли НЕ варто
- Невеликі набори тестів (менше 50 запитань), де для статистичного аналізу недостатньо вибірки.
- Ручне якісне тестування промптів, яке не спирається на стандартизовані метрики.
Що зробити сьогодні
- Проведіть аудит внутрішніх наборів оцінки моделей за допомогою BenchMIRT для вилучення надлишкових тестів.
- Скоротіть обсяг тестових наборів у CI/CD пайплайнах для економії токенів під час файнтюнінгу.
Джерела