Інститут Аллена випустив фреймворк TutorMoments для оцінки дій AI-агентів
Інститут Аллена випустив TutorMoments — відкритий фреймворк для вимірювання здатності LLM балансувати між допомогою та наданням автономії. Тестування 7 моделей довело, що спеціально налаштовані системні промпти суттєво підвищують точність рішень порівняно з базовими.
Вплив: Середній
Чому це важливо
Застосовуйте промпти з врахуванням специфіки завдань, щоб запобігти надмірному втручанню та передчасній допомозі агентів.
TL;DR
- 01Стандартні промпти асистента часто призводять до надмірної допомоги та передчасного виконання задач
- 02Явне визначення умов допомоги в системному промпті суттєво підвищує точність дій агента
- 03Використовуйте відкритий пайплайн TutorMoments для оцінки поведінки власного агента
Ключові факти
- Транскрипти датасету
- 462 текстові транскрипти
- Анотовані моменти
- Понад 1 500 точок прийняття рішень
- Оцінені LLM
- 7 мовних моделей
- Оцінка допомоги людей-тьюторів
- 0.458
- Оцінка вимогливості людей-тьюторів
- 0.182
Баланс між допомогою та автономією
Інститут Аллена представив TutorMoments — відкритий бенчмарк оцінки того, як LLM балансують між допомогою користувачеві та підтримкою автономного рішення проблем. Створений на основі 462 транскриптів та 1 500+ анотованих точок прийняття рішень, фреймворк вимірює поведінку моделей у мульти-турнірних симуляціях.
Вплив структури промпту
Тестування семи провідних LLM показало, що стандартні промпти 'корисного асистента' демонструють низьку точність вибору моменту для допомоги. Проте використання спеціальних оціночних промптів суттєво підвищило показники всіх моделей:
- Базовий рівень людини: Допомога
0.458, Вимогливість0.182 - Ефект оціночного промпту: Покращення відповідності дій та точності прийняття рішень для всіх моделей
✓ Коли використовувати
- Проектування системних промптів для інтерактивних AI-асистентів та тьюторів
- Бенчмаркінг інтерактивних LLM-агентів для запобігання передчасному вирішенню задач
✕ Коли НЕ варто
- Оцінка детермінованих фонових конвеєрів обробки даних
- Прості завдання виконання дій без участі користувача
Що зробити сьогодні
- Клонуйте репозиторій TutorMoments у GitHub для тестування логіки оцінки агентів
- Оновіть системні промпти агентів чіткими правилами стосовно того, коли ставити уточнювальні запитання, а коли виконувати код
Джерела