Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Агенти й MCP/
  4. NVIDIA показує, що кастомна обв'язка та супервізори перевершують сирі флагманські LLM
Агенти й MCP

NVIDIA показує, що кастомна обв'язка та супервізори перевершують сирі флагманські LLM

Нове дослідження NVIDIA показує, що програмна обв'язка (harness) навколо ШІ-моделі — керована пам'ять, контекст і зворотратний зв'язок — суттєво визначає успіх агента в тривалих завданнях. Завдяки кастомній обв'язці Agentic Variation Operators (AVO) із супервізором модель Claude Opus 5 досягла 100% результату на бенчмарку ARC-AGI-3 проти 30% у базовому режимі.

22 серпня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 22 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
NVIDIA показує, що кастомна обв'язка та супервізори перевершують сирі флагманські LLM

Вплив: Високий

Чому це важливо

Розробники можуть подвоїти надійність агентів та зменшити витрати токенів завдяки супервізорним циклам і кастомним середовищам виконання замість очікування потужніших моделей.

TL;DR

  • 01Двохагентна архітектура (виконавець + супервізор) запобігає зацикленню та значно підвищує успішність складних завдань.
  • 02Оптимізована обв'язка пам'яті дозволяє зменшити витрати на API LLM до 50%.
  • 03Інструменти з відкритим кодом, такі як NVIDIA NeMo, дають змогу налаштовувати рантайм та управління контекстом.

Ключові факти

Результат ARC-AGI-3 (Opus 5 + AVO Harness)100%
Результат ARC-AGI-3 (Opus 5 автономно)30%
Результат ARC-AGI-3 (Opus 5 + AVO Harness)
100%
Результат ARC-AGI-3 (Opus 5 автономно)
30%
Різниця у витратах токенів (дизайн обв'язки)
До 2x (дослідження Databricks)

Архітектура обв'язки замість масштабування моделей

Останні тести автономних систем у тривалих завданнях доводять, що програмна архітектура впливає на результат більше, ніж розмір моделі. Обгортання Claude Opus 5 у каркас Agentic Variation Operators (AVO) від NVIDIA дозволило досягти 100% на бенчмарку ARC-AGI-3 порівняно з 30% без обв'язки.

Роль агента-супервізора

Ключовим фактором зростання точності є впровадження другого агента-контролера у цикл виконання. Супервізор стежить за прогресом, виявляє циклічні дії та відправляє коригувальні інструкції, якщо основний агент заходить у глухий кут.

Вплив на вартість та рантайм

  • Витрати токенів: Згідно з даними Databricks, неправильно побудована обв'язка збільшує витрати токенів у 2 рази на тих самих завданнях.
  • Відкритий стек: NVIDIA надає модульні компоненти для побудови обв'язок у межах відкритого фреймворку NVIDIA NeMo.

Спробуй за 2 хвилини

# Conceptual supervisor loop pattern for agent harnesses
def run_supervised_agent(task, worker_agent, supervisor_agent):
    history = []
    for step in range(MAX_STEPS):
        action = worker_agent.step(task, history)
        history.append(action)
        feedback = supervisor_agent.evaluate(history)
        if feedback.is_stuck:
            worker_agent.inject_prompt(feedback.correction_hint)
        if feedback.is_complete:
            return feedback.result

python

✓ Коли використовувати

  • Розробка багатокрокових автономних ШІ-агентів з високими вимогами до надійності.
  • Оптимізація мультиагентних систем для запобігання зацикленням та перевитратам токенів.

Що зробити сьогодні

  • →Додайте легкий шар супервізії у складні агентські воркфлоу для виявлення зациклень.
  • →Проведіть аудит збереження стану обв'язки агента, щоб зменшити дублювання контексту та перевитрату токенів.
  • →Ознайомтеся з модульними компонентами обв'язки у відкритому фреймворку NVIDIA NeMo.
#Claude Code#Claude Opus 5#NVIDIA NeMo#Cursor#Codex

Джерела

  • Nvidia just showed that the harness, not the AI model, is now the real hero
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаЗастарілі моделі Claude уразливі до багатокрокових промпт-ін'єкцій на сторонніх API

Схожі матеріали

  • Агенти й MCPІзоляція паралельних AI-агентів розробки в окремі хмарні віртуальні машини
  • Агенти й MCPКорпоративний паттерн Model Context Protocol вимагає підтвердження змін та ізоляції ін'єкцій
  • Агенти й MCPАвтоматизація вилучення еталонних даних за допомогою подвійного LLM-шлюзу та агентного арбітражу
  • Агенти й MCPGrok Bot аналізує відеозаписи екрана з аудіо для автоматизації рутинних завдань

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.