Google ToolGrad генерує датасети виклику інструментів методом від відповіді до запиту
Google представила на ACL 2026 фреймворк ToolGrad, що генерує верифіковані ланцюжки викликів API ще до створення запиту користувача. Тонке налаштування відкритої моделі Gemma-3-12B лише на 500 траєкторіях ToolGrad дало їй змогу набрати 83,1 бала на Berkeley Function Calling Leaderboard, зрівнявшись із Gemini 2.5 Pro та випередивши GPT-5.

Вплив: Високий
Чому це важливо
Ви можете генерувати датасети виклику інструментів із майже 100% успішністю та налаштовувати компактні локальні моделі до рівня комерційних API.
TL;DR
- 01Генерація за принципом від відповіді до запиту усуває марні спроби DFS-пошуку, забезпечуючи майже 100% валідних зразків.
- 02Текстові градієнти зі звітів паралельного виконання спрямовують побудову довгих ланцюжків викликів API.
- 03Gemma-3-12B після налаштування на 500 зразках ToolGrad набрала 83,1 бала на BFCL, випередивши GPT-5 та зрівнявшись із Gemini 2.5 Pro.
Ключові факти
- Результат ToolGrad-12B на BFCL
- 83,1 (за даними авторів)
- Результат Gemini 2.5 Pro на BFCL
- 83,2
- Результат Claude 4.5 Opus на BFCL
- 82,8
- Результат GPT-5 на BFCL
- 74,4
- Успішність генерації даних
- Майже 100%
- База API ToolBench
- Понад 16 000 реальних API
Інверсія парадигми: від відповіді до запиту
Традиційна генерація датасетів для виклику інструментів спирається на попереднє створення запиту користувача з подальшим пошуком у глибину (DFS) серед великих пулів API. Такий підхід нераціонально спалює токени через численні тупикові гілки. ToolGrad, представлений дослідниками Google XR на ACL 2026, розгортає конвеєр у зворотному напрямку: спочатку створюється валідний ланцюжок викликів API. Оскільки виконана послідовність містить чіткі параметри та результати, генерація відповідного запиту користувача вимагає лише одного кроку великої мовної моделі (LLM), забезпечуючи майже 100% успішних зразків.
Текстові градієнти та чотиримодульна архітектура
ToolGrad адаптує концепцію текстових градієнтів із TextGrad, використовуючи описовий текстовий зворотний зв'язок як вектор для оптимізації робочих процесів. Фреймворк складається з чотирьох послідовних модулів:
- API Proposer: звужує вибірку з бібліотеки (наприклад, понад 16 000 реальних API у ToolBench) до найбільш релевантних кандидатів.
- API Executors: паралельно запускає вибрані виклики та формує детальні звіти виконання.
- API Selector: аналізує логи, вибирає оптимальний виклик у ролі текстового градієнта та додає його до ланцюжка.
- LLM Updater: синхронізує синтетичний запит і фінальну відповідь моделі з оновленим набором API.
Результати тестування на BFCL
Використовуючи gemini-2.5-flash-lite для генерації, автори створили датасет ToolGrad-500 (500 зразків) і провели тонке налаштування моделей Gemma-3 (1B, 4B і 12B). На бенчмарку Berkeley Function Calling Leaderboard (BFCL) з незнайомими інструментами модель ToolGrad-12B набрала 83,1 бала. Вона випередила gpt-5 (74,4), claude-4.5 Opus (82,8), спеціалізовані відкриті моделі на зразок ToolACE і Hammer-2.1-7B, а також зрівнялася з gemini-2.5-pro (83,2), довівши, що модель-учень здатна перевершити власну модель-вчителя.
✓ Коли використовувати
- Генерація синтетичних датасетів виклику функцій для тонкого налаштування локальних моделей на зразок Gemma-3.
- Побудова довгих агентних процесів із залежностями між кількома зовнішніми API.
- Дистиляція навичок роботи з інструментами з дорогих комерційних моделей у компактні відкриті моделі.
✕ Коли НЕ варто
- Сценарії, де виклики API неможливо безпечно ізолювати в пісочниці під час генерації даних.
- Прості однокрокові діалогові задачі, які не потребують зовнішніх інструментів або викликів API.
Що зробити сьогодні
- Проведіть аудит власних конвеєрів синтетичних даних і протестуйте генерацію ланцюжків API до формулювання промптів.
- Протестуйте локальну Gemma-3-12B на внутрішніх схемах API за протоколом BFCL для порівняння з комерційними API.
- Впровадьте зворотний зв'язок середовища виконання (текстові градієнти) для відсікання тупикових гілок під час навчання агентів.
Джерела