CrucibleBench оцінює AI-агентів за допомогою MUD та викриває хиби LLM-суддів
CrucibleBench використовує текстові підземелля для тестування поведінки AI-агентів у складних соціальних середовищах. Оцінка показує, що використання LLM у ролі суддів змінює рейтинги моделей до шести позицій, а також виявляє циклічні помилки у провідних моделей.
Вплив: Високий
Чому це важливо
Інженери можуть аудіювати поведінкові збої агентів та замінювати ненадійних LLM-суддів детермінованою телеметрією скінченного автомата.
TL;DR
- 01LLM-судді можуть непомітно змінювати позиції моделей у рейтингу на 6 місць через низьку узгодженість.
- 02Зациклення діалогу виникає у майже 66% запусків агентів, коли персистентний стан вимагає адаптації.
- 03Телеметрія автомата станів дозволяє точно виявляти галюциновані виклики API без ймовірнісних LLM-суддів.
Ключові факти
- Кількість кімнат
- 12
- Кількість предметів
- 14
- Кількість NPC
- 4
- Частота зациклення діалогу
- 14-66% запусків провідних моделей
- Діапазон узгодженості суддів
- 21.7% - 84.8%
- Розмір датасету бенчмарку
- 650 повних транскриптів
Персистентне середовище для бенчмаркінгу агентів
CrucibleBench тестує моделі у текстовому підземеллі з 12 кімнатами, 14 предметами та 4 NPC із показниками довіри й підозри від 0 до 100. Оскільки підняті речі залишаються вилученими, а дії обмежені суворим парсером команд, кроки з галюцинованими API або некоректними переходами фіксуються алгоритмічно.
Нестабільність оцінювання за допомогою LLM-суддів
Дослідження виявило, що включення LLM-класифікатора в пайплайн оцінювання змінює рейтинги моделей до шести позицій. Узгодженість між LLM-суддею та незалежним арбітром коливалася від 21,7% до 84,8%, хоча загальний коефіцієнт Каппа показував оманливе значення 0,04.
Алгоритмічні збої у провідних моделях
Телеметрія автоматів станів виявила три ключові типи збоїв під час 50 запусків на модель:
- Зациклення діалогу: Спостерігалося у 14–66% запусків флагманських моделей, коли агент повторював команду
talkбез зміни стратегії. - Взаємодія з чужою кімнатою: Grok 4 у 12% випадків звертався до неіснуючих об'єктів у порожніх кімнатах.
- Параліч дослідження: Моделі багаторазово виконували команду
lookабо не виходили за межі 2 кімнат протягом 20+ ходів.
Спробуй за 2 хвилини
git clone https://github.com/cruciblebench/cruciblebench.git && cd cruciblebench && python eval.py --model anthropic/claude-3-5-sonnetbash
✓ Коли використовувати
- Під час проектування поведінкових бенчмарків для багатокрокових AI-агентів.
- Під час перевірки надійності LLM-суддів та стабільності рейтингів у системах оцінювання.
✕ Коли НЕ варто
- Не підходить для оцінювання однокрокового відтворення фактів або синтаксису коду.
- Не є єдиним абсолютним показником загального інтелекту без доменної калібрування.
Що зробити сьогодні
- Проведіть аудит власних LLM-пайплайнів оцінювання, вимірявши узгодженість класифікаторів.
- Додайте детекцію циклів у продакшн-агенти для примусового переривання повторюваних викликів інструментів.
- Завантажте 650 транскриптів CrucibleBench для аналізу поведінкових помилок агентів.
Що каже спільнота
“Learn about agent loops, prompting iteration, etc. I vibe coded a few room proof of concept MUD. I added a tools called oracle that it could ask me questions to help along its way.”
Джерела