IBM ALTK-Evolve виявляє та усуває стохастичні збої в агентах
IBM Research представила Consistency Analyzer у бібліотеці ALTK-Evolve для пошуку нестабільних кроків у ланцюжках дій ШІ-агентів. Завдяки офлайн-ресемплінгу та ін'єкції стабілізаційних інструкцій розрив повторюваності на AppWorld скоротився з 24.4 до 12.0 відсоткових пунктів.

Вплив: Високий
Чому це важливо
Висока середня точність маскує критичну ненадійність: агент із точністю 77% може випадково провалювати ті самі завдання через пологий розподіл ймовірностей токенів. ALTK-Evolve вирішує проблему повторюваності в продакшені без донавчання моделі.
TL;DR
- 01Метрика Pass^k вимірює надійність на кожному запуску, розкриваючи збої, які маскує Mean@k.
- 02Пологі розподіли токенів спричиняють збої навіть при temperature 0.0 через апаратний шум хостингу.
- 03ALTK-Evolve створює цільові правила стабільності через black-box ресемплінг і вдвічі скорочує розрив повторюваності.
Ключові факти
- Початковий Mean@5 (GPT-4.1 AppWorld)
- 77.4%
- Початковий Pass^5 (GPT-4.1 AppWorld)
- 53.0%
- Розрив повторюваності
- 24.4 в.п.
- Pass^5 після оптимізації
- 69.0%
- Розрив після оптимізації
- 12.0 в.п.
Прихований розрив повторюваності в ШІ-агентах
Традиційні лідерборди спираються на Mean@k, але реальним робочим процесам потрібна метрика Pass^k — гарантія успіху на кожному повторенні. ReAct-агент на базі GPT-4.1 у бенчмарку AppWorld test_normal показав середню точність Mean@5 на рівні 77.4%, проте Pass^5 склав лише 53.0%. Це утворює 24.4 відсоткових пунктів розриву, коли агент непередбачувано падає на тих самих задачах.
Чому жадібне декодування не гарантує детермінізму
Навіть при temperature 0.0 поведінка моделі коливається через апаратний батчинг та неасоціативність обчислень із плаваючою комою на GPU. Якщо розподіл ймовірностей наступного токена є пологим, найменший числовий шум змінює вибір аргументу функції.
Офлайн-діагностика на базі єдиного трейсу
Consistency Analyzer у складі ALTK-Evolve виявляє нестабільні місця без розміченого датасету: 1. Відтворює кожен крок прийняття рішень через один запит на k=5 паралельних генерацій. 2. Розраховує показник узгодженості на основі варіативності відповідей без доступу до внутрішніх логітів, фіксуючи кроки з ризиком зміни поведінки. 3. Генерує цільові правила стабілізації (наприклад, вимогу перевіряти множинні результати пошуку).
Додавання таких правил у контекст скоротило розрив повторюваності на AppWorld з 24.4 до 12.0 в.п., підвищивши Pass^5 до 69.0%.
✓ Коли використовувати
- Критично важливі агентні робочі процеси на зразок звірки фінансів або аудиту договорів, де кожен запуск має бути успішним.
✕ Коли НЕ варто
- Прості однокрокові завдання без розгалужень та ланцюжків виклику інструментів.
Що зробити сьогодні
- Проведіть аудит наявних ReAct-агентів за метрикою Pass^k щонайменше на 5 повторних запусках.
- Впровадьте black-box ресемплінг на k генерацій для виявлення нестабільних кроків у трейсах.
Джерела