Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Агенти й MCP/
  4. Google ToolGrad генерує датасети виклику інструментів методом від відповіді до запиту
Агенти й MCP

Google ToolGrad генерує датасети виклику інструментів методом від відповіді до запиту

Google представила на ACL 2026 фреймворк ToolGrad, що генерує верифіковані ланцюжки викликів API ще до створення запиту користувача. Тонке налаштування відкритої моделі Gemma-3-12B лише на 500 траєкторіях ToolGrad дало їй змогу набрати 83,1 бала на Berkeley Function Calling Leaderboard, зрівнявшись із Gemini 2.5 Pro та випередивши GPT-5.

12 вересня 2026 р.· 7 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 12 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Google ToolGrad генерує датасети виклику інструментів методом від відповіді до запиту

Вплив: Високий

Чому це важливо

Ви можете генерувати датасети виклику інструментів із майже 100% успішністю та налаштовувати компактні локальні моделі до рівня комерційних API.

TL;DR

  • 01Генерація за принципом від відповіді до запиту усуває марні спроби DFS-пошуку, забезпечуючи майже 100% валідних зразків.
  • 02Текстові градієнти зі звітів паралельного виконання спрямовують побудову довгих ланцюжків викликів API.
  • 03Gemma-3-12B після налаштування на 500 зразках ToolGrad набрала 83,1 бала на BFCL, випередивши GPT-5 та зрівнявшись із Gemini 2.5 Pro.

Ключові факти

83,2Результат Gemini 2.5 Pro на BFCL
82,8Результат Claude 4.5 Opus на BFCL
74,4Результат GPT-5 на BFCL
Майже 100%Успішність генерації даних
Результат ToolGrad-12B на BFCL
83,1 (за даними авторів)
Результат Gemini 2.5 Pro на BFCL
83,2
Результат Claude 4.5 Opus на BFCL
82,8
Результат GPT-5 на BFCL
74,4
Успішність генерації даних
Майже 100%
База API ToolBench
Понад 16 000 реальних API

Інверсія парадигми: від відповіді до запиту

Традиційна генерація датасетів для виклику інструментів спирається на попереднє створення запиту користувача з подальшим пошуком у глибину (DFS) серед великих пулів API. Такий підхід нераціонально спалює токени через численні тупикові гілки. ToolGrad, представлений дослідниками Google XR на ACL 2026, розгортає конвеєр у зворотному напрямку: спочатку створюється валідний ланцюжок викликів API. Оскільки виконана послідовність містить чіткі параметри та результати, генерація відповідного запиту користувача вимагає лише одного кроку великої мовної моделі (LLM), забезпечуючи майже 100% успішних зразків.

Текстові градієнти та чотиримодульна архітектура

ToolGrad адаптує концепцію текстових градієнтів із TextGrad, використовуючи описовий текстовий зворотний зв'язок як вектор для оптимізації робочих процесів. Фреймворк складається з чотирьох послідовних модулів:

  • API Proposer: звужує вибірку з бібліотеки (наприклад, понад 16 000 реальних API у ToolBench) до найбільш релевантних кандидатів.
  • API Executors: паралельно запускає вибрані виклики та формує детальні звіти виконання.
  • API Selector: аналізує логи, вибирає оптимальний виклик у ролі текстового градієнта та додає його до ланцюжка.
  • LLM Updater: синхронізує синтетичний запит і фінальну відповідь моделі з оновленим набором API.

Результати тестування на BFCL

Використовуючи gemini-2.5-flash-lite для генерації, автори створили датасет ToolGrad-500 (500 зразків) і провели тонке налаштування моделей Gemma-3 (1B, 4B і 12B). На бенчмарку Berkeley Function Calling Leaderboard (BFCL) з незнайомими інструментами модель ToolGrad-12B набрала 83,1 бала. Вона випередила gpt-5 (74,4), claude-4.5 Opus (82,8), спеціалізовані відкриті моделі на зразок ToolACE і Hammer-2.1-7B, а також зрівнялася з gemini-2.5-pro (83,2), довівши, що модель-учень здатна перевершити власну модель-вчителя.

✓ Коли використовувати

  • Генерація синтетичних датасетів виклику функцій для тонкого налаштування локальних моделей на зразок Gemma-3.
  • Побудова довгих агентних процесів із залежностями між кількома зовнішніми API.
  • Дистиляція навичок роботи з інструментами з дорогих комерційних моделей у компактні відкриті моделі.

✕ Коли НЕ варто

  • Сценарії, де виклики API неможливо безпечно ізолювати в пісочниці під час генерації даних.
  • Прості однокрокові діалогові задачі, які не потребують зовнішніх інструментів або викликів API.

Що зробити сьогодні

  • →Проведіть аудит власних конвеєрів синтетичних даних і протестуйте генерацію ланцюжків API до формулювання промптів.
  • →Протестуйте локальну Gemma-3-12B на внутрішніх схемах API за протоколом BFCL для порівняння з комерційними API.
  • →Впровадьте зворотний зв'язок середовища виконання (текстові градієнти) для відсікання тупикових гілок під час навчання агентів.
#ToolGrad#Gemma-3#Gemini#Claude#GPT-5#ToolBench#ToolACE

Джерела

  • Google Research: ToolGrad: Efficient tool-use dataset generation with textual gradients
ПоділитисяПоділитися в XПоділитися в LinkedIn
Наступна новина →OpenAI переписала сервіс сховища на Rust силами двох інженерів і ШІ

Схожі матеріали

  • Агенти й MCPАвтономні агенти OpenAI атакували репозиторій пакетів RubyGems у нерозкритій атаці
  • Агенти й MCPТранскрипт Anthropic розкрив проблеми ШІ-агента з CAPTCHA під час виходу з пісочниці
  • Агенти й MCPПроєктування драбини дозволів та обмеження радіуса ураження автономних агентів
  • Агенти й MCPMeta випустила автономного персонального агента Muse з ізольованою пісочницею

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.