Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. AllenAI презентує BenchMIRT для аудиту та скорочення бенчмарків LLM
Моделі й дослідження

AllenAI презентує BenchMIRT для аудиту та скорочення бенчмарків LLM

Allen Institute for AI випустив відкритий інструмент BenchMIRT, який застосовує багатовимірну теорію тестування для аналізу бенчмарків LLM. Аналіз 100 моделей та 34 000 запитань показав, що лише 10% найефективніших тестів забезпечують повну оцінку здібностей моделі.

2 вересня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 2 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
AllenAI презентує BenchMIRT для аудиту та скорочення бенчмарків LLM

Вплив: Середній

Чому це важливо

Команди, що тестують власні моделі, можуть скоротити час тестування та витрати на токени до 90%, прибравши малоінформативні тестові запитання.

TL;DR

  • 01BenchMIRT застосовує теорію тестування для розділення сигналів логіки та безпеки в бенчмарках LLM.
  • 02Набори тестів можна скоротити на 90% без втрати точності рейтингування моделей.
  • 03Популярні бенчмарки на кшталт BBQ та WMDP здебільшого вимірюють загальну логіку, а не тільки безпеку.

Ключові факти

Скорочення тестового набору10% запитань зберігають точність рейтингу
Точність прогнозування відповідей79% на нових тестових запитаннях
Кількість перевірених моделей
100 відкритих LLM
Проаналізовано запитань
34 000+ у межах 16 бенчмарків
Скорочення тестового набору
10% запитань зберігають точність рейтингу
Точність прогнозування відповідей
79% на нових тестових запитаннях

Психометричний аудит бенчмарків

AllenAI представила відкритий фреймворк BenchMIRT, який використовує багатовимірну теорію тестування (MIRT) для аналізу тестових запитань LLM на рівні окремих промптів. Інструмент визначає, наскільки кожне завдання допомагає відрізнити сильну модель від слабкої.

Розділення змішаних сигналів

Проаналізувавши 100 моделей на 16 бенчмарках (зокрема MMLU-Pro, GPQA, MATH, HarmBench та WildJailbreak), система виділила два незалежні вектори — безпеку та логічне мислення:

  • BBQ (тест на упередженість): корелює здебільшого з логічним мисленням, а не з безпекою.
  • WMDP (небезпечні знання): результати відображають загальну логіку, де сильніші моделі часто отримують нижчий бал через відмову генерувати контент.
  • HarmBench: класичні запитання вимірюють безпеку, тоді як тести на авторське право — загальну ерудицію.

Скорочення обсягу тестів на 90%

Відбір 10% найбільш показових завдань дозволяє зберегти майже ідентичний рейтинг моделей. Окрім цього, статистична модель BenchMIRT передбачає відповідь моделі на нові запитання з точністю 79% (проти 70% у базових підходів).

Спробуй за 2 хвилини

git clone https://github.com/allenai/BenchMIRT
cd BenchMIRT
pip install -r requirements.txt

bash

✓ Коли використовувати

  • Оптимізація пайплайнів автоматичного тестування під час навчання та файнтюнінгу моделей.
  • Аудит внутрішніх датасетів безпеки для усунення неінформативних або шумних тестів.

✕ Коли НЕ варто

  • Невеликі набори тестів (менше 50 запитань), де для статистичного аналізу недостатньо вибірки.
  • Ручне якісне тестування промптів, яке не спирається на стандартизовані метрики.

Що зробити сьогодні

  • →Проведіть аудит внутрішніх наборів оцінки моделей за допомогою BenchMIRT для вилучення надлишкових тестів.
  • →Скоротіть обсяг тестових наборів у CI/CD пайплайнах для економії токенів під час файнтюнінгу.
#BenchMIRT#MMLU-Pro#GPQA#HarmBench#WildJailbreak#BBQ#WMDP

Джерела

  • Hugging Face Blog: BenchMIRT - What are LLM benchmarks actually measuring?
  • GitHub: allenai/BenchMIRT
  • BenchMIRT Technical Report
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаAnthropic презентує Enterprise Frontier Safeguards зі збереженням даних у клієнта

Схожі матеріали

  • Моделі й дослідженняGoogle випустила TimesFM-3 для zero-shot мультиваріантного прогнозування часових рядів
  • Моделі й дослідженняAnthropic продемонструвала автоматизовані дослідники вирівнювання AI за чотири долари на годину
  • Моделі й дослідженняHugging Face Open ASR Leaderboard додає датасет Monsoon для оцінювання індійських мов
  • Моделі й дослідженняФреймворк DeepMind StoryScope виявив структурні наративні патерни у провідних LLM

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.