Інструменти й релізиВплив: Високий
Microsoft та Hugging Face випустили бенчмарк ThinkingBox для агентів зі зміною стану
Microsoft та Hugging Face запустили бенчмарк ThinkingBox через OpenEnv, що оцінює агентів у 507 робочих процесах із 20 повтореннями. Дослідження виявило, що 67,24% невдалих спроб завершувалися без помилок інструментів, але насправді пошкоджували записи в базі даних.

Чому це важливо
Тестуйте продакшн-агентів за фактичними змінами стану бази даних у серіях повторень, а не за фінальними текстовими відповідями моделей.
TL;DR
- 01Понад дві третини невдалих операцій агентів завершуються без помилок у логах інструментів.
- 02Показники pass@1 для одиночних запусків не відображають стабільність агента в повторюваних робочих процесах.
- 03Claude Opus 5 та 5.5 продемонстрували 47,53% стабільності за 20 спроб, перевершивши моделі з високим pass@1.
Ключові факти
- Масштаб тестування
- 507 завдань із 20 повтореннями кожне
- Приховані збої
- 67,24% провалів завершилися без помилок інструментів
- Стабільність Opus 5 та 5.5
- Обидві пройшли всі 20 запусків у 241 із 507 завдань
- Найнижча вартість успіху
- $0,127 за успішне виконання (GPT-5.6 Sol)
Невідповідність між відповіддю агента та базою даних. Більшість оцінок агентів перевіряють текстові відповіді або синтаксис виклику функцій. Бенчмарк ThinkingBox від Microsoft запускає агентів в ізольованих сесіях Model Context Protocol на 507 завданнях і перевіряє фактичні мутації бази даних. В аналізі 121 680 спроб на 12 моделях 79 853 спроби не пройшли валідацію БД. Серед них 67,24% завершилися чисто без помилок інструментів, але перевірка стану виявила помилкові значення полів у 77,61% випадків, небажані сайд-ефекти у 43,30% та пропущені обов'язкові дії у 25,36%. ### Втрата стабільності при повтореннях. Тестування кожного процесу 20 разів поспіль виявило різкий розрив між разовим успіхом (pass@1) і надійністю (pass@20). Модель Kimi-K3 розв'язала 93,89% завдань хоча б один раз, але завершила всі 20 спроб лише для 13,41% завдань (68 із 507). На противагу цьому, Claude Opus 5 показав нижче загальне покриття (79,09%), але успішно пройшов усі 20 запусків для 47,53% завдань (241 процес). Оновлена Claude Opus 5.5 показала абсолютно ідентичний результат (241 завдання), попри вищий бал pass@1. ### Метрики вартості одиниці роботи. ThinkingBox розраховує витрати на кожне успішне виконання завдання. GPT-5.6 Sol показала найнижчу вартість успішної спроби — $0,127, тоді як GPT-5.4 досягла 65,36% pass@1 за ціною $0,131 за успіх. Тестування ThinkingBox доступне через середовище OpenEnv на платформі Hugging Face.
Спробуй за 2 хвилини
python -m openenv.run --benchmark thinkingbox --tasks 507 --repeats 20bash
✓ Коли використовувати
- Аудит агентів підтримки, білінгу чи складського обліку, які вносять зміни до баз даних.
- Тестування надійності оркестрації агентів у повторюваних виробничих процесах.
✕ Коли НЕ варто
- Прості сценарії написання коду, де розробник одразу перевіряє diff вручну.
- Одноразові інформаційні запити без модифікації даних та побічних ефектів.
Що зробити сьогодні
- Додайте перевірки стану бази даних замість того, щоб довіряти фінальній текстовій відповіді агента.
- Тестуйте критичні агентні процеси серіями від 10 до 20 повторів перед випуском у продакшн.
- Оцінюйте вартість успішно виконаного завдання, а не лише номінальну ціну вхідних та вихідних токенів.