Перейти до вмісту
ATAI Today Brief
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. CrucibleBench оцінює AI-агентів за допомогою MUD та викриває хиби LLM-суддів
Моделі й дослідження

CrucibleBench оцінює AI-агентів за допомогою MUD та викриває хиби LLM-суддів

22 липня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 22 липня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
CrucibleBench оцінює AI-агентів за допомогою MUD та викриває хиби LLM-суддів

CrucibleBench використовує текстові підземелля для тестування поведінки AI-агентів у складних соціальних середовищах. Оцінка показує, що використання LLM у ролі суддів змінює рейтинги моделей до шести позицій, а також виявляє циклічні помилки у провідних моделей.

Вплив: Високий

Чому це важливо

Інженери можуть аудіювати поведінкові збої агентів та замінювати ненадійних LLM-суддів детермінованою телеметрією скінченного автомата.

TL;DR

  • 01LLM-судді можуть непомітно змінювати позиції моделей у рейтингу на 6 місць через низьку узгодженість.
  • 02Зациклення діалогу виникає у майже 66% запусків агентів, коли персистентний стан вимагає адаптації.
  • 03Телеметрія автомата станів дозволяє точно виявляти галюциновані виклики API без ймовірнісних LLM-суддів.

Ключові факти

Кількість кімнат12
Кількість предметів14
Кількість NPC4
Розмір датасету бенчмарку650 повних транскриптів
Кількість кімнат
12
Кількість предметів
14
Кількість NPC
4
Частота зациклення діалогу
14-66% запусків провідних моделей
Діапазон узгодженості суддів
21.7% - 84.8%
Розмір датасету бенчмарку
650 повних транскриптів

Персистентне середовище для бенчмаркінгу агентів

CrucibleBench тестує моделі у текстовому підземеллі з 12 кімнатами, 14 предметами та 4 NPC із показниками довіри й підозри від 0 до 100. Оскільки підняті речі залишаються вилученими, а дії обмежені суворим парсером команд, кроки з галюцинованими API або некоректними переходами фіксуються алгоритмічно.

Нестабільність оцінювання за допомогою LLM-суддів

Дослідження виявило, що включення LLM-класифікатора в пайплайн оцінювання змінює рейтинги моделей до шести позицій. Узгодженість між LLM-суддею та незалежним арбітром коливалася від 21,7% до 84,8%, хоча загальний коефіцієнт Каппа показував оманливе значення 0,04.

Алгоритмічні збої у провідних моделях

Телеметрія автоматів станів виявила три ключові типи збоїв під час 50 запусків на модель:

  • Зациклення діалогу: Спостерігалося у 14–66% запусків флагманських моделей, коли агент повторював команду talk без зміни стратегії.
  • Взаємодія з чужою кімнатою: Grok 4 у 12% випадків звертався до неіснуючих об'єктів у порожніх кімнатах.
  • Параліч дослідження: Моделі багаторазово виконували команду look або не виходили за межі 2 кімнат протягом 20+ ходів.

Спробуй за 2 хвилини

git clone https://github.com/cruciblebench/cruciblebench.git && cd cruciblebench && python eval.py --model anthropic/claude-3-5-sonnet

bash

✓ Коли використовувати

  • Під час проектування поведінкових бенчмарків для багатокрокових AI-агентів.
  • Під час перевірки надійності LLM-суддів та стабільності рейтингів у системах оцінювання.

✕ Коли НЕ варто

  • Не підходить для оцінювання однокрокового відтворення фактів або синтаксису коду.
  • Не є єдиним абсолютним показником загального інтелекту без доменної калібрування.

Що зробити сьогодні

  • →Проведіть аудит власних LLM-пайплайнів оцінювання, вимірявши узгодженість класифікаторів.
  • →Додайте детекцію циклів у продакшн-агенти для примусового переривання повторюваних викликів інструментів.
  • →Завантажте 650 транскриптів CrucibleBench для аналізу поведінкових помилок агентів.

Що каже спільнота

  • “Learn about agent loops, prompting iteration, etc. I vibe coded a few room proof of concept MUD. I added a tools called oracle that it could ask me questions to help along its way.”

    — thomas536 на Hacker News

#CrucibleBench#OpenRouter#Grok 4#Claude

Джерела

  • CrucibleBench Website
  • Hacker News Discussion
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаOpenAI презентує Presence для надійного розгортання та оркестрації ШІ-агентівНаступна новина →Bento об'єднує редагування, перегляд та співпрацю в одному HTML-файлі презентації

Схожі матеріали

  • Моделі й дослідженняАгент OpenAI вийшов із пісочниці під час тестування: уроки ізоляції AI-агентів
  • Моделі й дослідженняСпеціалізований OCR перевершує великі моделі у вузькопрофільних тестах
  • Моделі й дослідженняNVIDIA Nemotron 3 Embed очолює бенчмарки пошуку
  • Моделі й дослідженняNeuroVFM: тривимірна медична модель, навчена на 5 мільйонах томограм мозку

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.