Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Агенти й MCP/
  4. IBM ALTK-Evolve виявляє та усуває стохастичні збої в агентах
Агенти й MCP

IBM ALTK-Evolve виявляє та усуває стохастичні збої в агентах

IBM Research представила Consistency Analyzer у бібліотеці ALTK-Evolve для пошуку нестабільних кроків у ланцюжках дій ШІ-агентів. Завдяки офлайн-ресемплінгу та ін'єкції стабілізаційних інструкцій розрив повторюваності на AppWorld скоротився з 24.4 до 12.0 відсоткових пунктів.

16 вересня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 16 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
IBM ALTK-Evolve виявляє та усуває стохастичні збої в агентах

Вплив: Високий

Чому це важливо

Висока середня точність маскує критичну ненадійність: агент із точністю 77% може випадково провалювати ті самі завдання через пологий розподіл ймовірностей токенів. ALTK-Evolve вирішує проблему повторюваності в продакшені без донавчання моделі.

TL;DR

  • 01Метрика Pass^k вимірює надійність на кожному запуску, розкриваючи збої, які маскує Mean@k.
  • 02Пологі розподіли токенів спричиняють збої навіть при temperature 0.0 через апаратний шум хостингу.
  • 03ALTK-Evolve створює цільові правила стабільності через black-box ресемплінг і вдвічі скорочує розрив повторюваності.

Ключові факти

Початковий Mean@5 (GPT-4.1 AppWorld)77.4%
Початковий Pass^5 (GPT-4.1 AppWorld)53.0%
Pass^5 після оптимізації69.0%
Початковий Mean@5 (GPT-4.1 AppWorld)
77.4%
Початковий Pass^5 (GPT-4.1 AppWorld)
53.0%
Розрив повторюваності
24.4 в.п.
Pass^5 після оптимізації
69.0%
Розрив після оптимізації
12.0 в.п.

Прихований розрив повторюваності в ШІ-агентах

Традиційні лідерборди спираються на Mean@k, але реальним робочим процесам потрібна метрика Pass^k — гарантія успіху на кожному повторенні. ReAct-агент на базі GPT-4.1 у бенчмарку AppWorld test_normal показав середню точність Mean@5 на рівні 77.4%, проте Pass^5 склав лише 53.0%. Це утворює 24.4 відсоткових пунктів розриву, коли агент непередбачувано падає на тих самих задачах.

Чому жадібне декодування не гарантує детермінізму

Навіть при temperature 0.0 поведінка моделі коливається через апаратний батчинг та неасоціативність обчислень із плаваючою комою на GPU. Якщо розподіл ймовірностей наступного токена є пологим, найменший числовий шум змінює вибір аргументу функції.

Офлайн-діагностика на базі єдиного трейсу

Consistency Analyzer у складі ALTK-Evolve виявляє нестабільні місця без розміченого датасету: 1. Відтворює кожен крок прийняття рішень через один запит на k=5 паралельних генерацій. 2. Розраховує показник узгодженості на основі варіативності відповідей без доступу до внутрішніх логітів, фіксуючи кроки з ризиком зміни поведінки. 3. Генерує цільові правила стабілізації (наприклад, вимогу перевіряти множинні результати пошуку).

Додавання таких правил у контекст скоротило розрив повторюваності на AppWorld з 24.4 до 12.0 в.п., підвищивши Pass^5 до 69.0%.

✓ Коли використовувати

  • Критично важливі агентні робочі процеси на зразок звірки фінансів або аудиту договорів, де кожен запуск має бути успішним.

✕ Коли НЕ варто

  • Прості однокрокові завдання без розгалужень та ланцюжків виклику інструментів.

Що зробити сьогодні

  • →Проведіть аудит наявних ReAct-агентів за метрикою Pass^k щонайменше на 5 повторних запусках.
  • →Впровадьте black-box ресемплінг на k генерацій для виявлення нестабільних кроків у трейсах.
#ALTK-Evolve#Consistency Analyzer#GPT-4.1#AppWorld

Джерела

  • Your Agent Aced the Task. Will It Do It Again?
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаGoogle випустила аудіо-модель Gemini 3.8 Live Extended ThinkingНаступна новина →Salesforce та NVIDIA представили модель Koa на базі Nemotron

Схожі матеріали

  • Агенти й MCPВідображення стану агентів кодингу в списку вікон Tmux
  • Агенти й MCPПортування агентів даних Apache Iceberg між трьома хмарними фреймворками
  • Агенти й MCPФреймворки Apple Siri відкривають протоколи делегування моделей та зовнішнього інференсу
  • Агенти й MCPЗбереження коду агентів під час стиснення контексту в ChatGPT Work

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.