NVIDIA показує, що кастомна обв'язка та супервізори перевершують сирі флагманські LLM
Нове дослідження NVIDIA показує, що програмна обв'язка (harness) навколо ШІ-моделі — керована пам'ять, контекст і зворотратний зв'язок — суттєво визначає успіх агента в тривалих завданнях. Завдяки кастомній обв'язці Agentic Variation Operators (AVO) із супервізором модель Claude Opus 5 досягла 100% результату на бенчмарку ARC-AGI-3 проти 30% у базовому режимі.

Вплив: Високий
Чому це важливо
Розробники можуть подвоїти надійність агентів та зменшити витрати токенів завдяки супервізорним циклам і кастомним середовищам виконання замість очікування потужніших моделей.
TL;DR
- 01Двохагентна архітектура (виконавець + супервізор) запобігає зацикленню та значно підвищує успішність складних завдань.
- 02Оптимізована обв'язка пам'яті дозволяє зменшити витрати на API LLM до 50%.
- 03Інструменти з відкритим кодом, такі як NVIDIA NeMo, дають змогу налаштовувати рантайм та управління контекстом.
Ключові факти
- Результат ARC-AGI-3 (Opus 5 + AVO Harness)
- 100%
- Результат ARC-AGI-3 (Opus 5 автономно)
- 30%
- Різниця у витратах токенів (дизайн обв'язки)
- До 2x (дослідження Databricks)
Архітектура обв'язки замість масштабування моделей
Останні тести автономних систем у тривалих завданнях доводять, що програмна архітектура впливає на результат більше, ніж розмір моделі. Обгортання Claude Opus 5 у каркас Agentic Variation Operators (AVO) від NVIDIA дозволило досягти 100% на бенчмарку ARC-AGI-3 порівняно з 30% без обв'язки.
Роль агента-супервізора
Ключовим фактором зростання точності є впровадження другого агента-контролера у цикл виконання. Супервізор стежить за прогресом, виявляє циклічні дії та відправляє коригувальні інструкції, якщо основний агент заходить у глухий кут.
Вплив на вартість та рантайм
- Витрати токенів: Згідно з даними Databricks, неправильно побудована обв'язка збільшує витрати токенів у 2 рази на тих самих завданнях.
- Відкритий стек: NVIDIA надає модульні компоненти для побудови обв'язок у межах відкритого фреймворку
NVIDIA NeMo.
Спробуй за 2 хвилини
# Conceptual supervisor loop pattern for agent harnesses
def run_supervised_agent(task, worker_agent, supervisor_agent):
history = []
for step in range(MAX_STEPS):
action = worker_agent.step(task, history)
history.append(action)
feedback = supervisor_agent.evaluate(history)
if feedback.is_stuck:
worker_agent.inject_prompt(feedback.correction_hint)
if feedback.is_complete:
return feedback.resultpython
✓ Коли використовувати
- Розробка багатокрокових автономних ШІ-агентів з високими вимогами до надійності.
- Оптимізація мультиагентних систем для запобігання зацикленням та перевитратам токенів.
Що зробити сьогодні
- Додайте легкий шар супервізії у складні агентські воркфлоу для виявлення зациклень.
- Проведіть аудит збереження стану обв'язки агента, щоб зменшити дублювання контексту та перевитрату токенів.
- Ознайомтеся з модульними компонентами обв'язки у відкритому фреймворку NVIDIA NeMo.
Джерела