Источник: research.google
ИИ-агенты уже умеют автоматизировать практические задачи: выполнять поиск в Google, читать локальные файлы на компьютере и запускать сгенерированные скрипты на Python. Чтобы такие сценарии работали, большие языковые модели должны правильно и эффективно пользоваться инструментами.
Для обучения нужны наборы данных с цепочками вызовов инструментов и соответствующими пользовательскими запросами. В предыдущей работе авторы вручную размечали тестовые данные, но такой подход невозможно масштабировать для обучения современных ИИ-моделей.
ToolBench и ToolACE предложили автоматизировать подготовку данных с помощью агента, который методом проб и ошибок ищет путь использования инструментов. В этом подходе:
Такая схема неэффективна: ей приходится извлекать полезные последовательности действий из сложного процесса исследования, чтобы затем использовать их для обучения модели.
В работе «ToolGrad: Efficient Tool-use Dataset Generation with Textual “Gradients”», представленной на ACL 2026, исследователи описали другой принцип. ToolGrad сначала создаёт эталонную цепочку вызовов инструментов, а затем формирует соответствующий пользовательский промт. Готовое решение содержит более однозначную информацию, чем исходный запрос, поэтому переход от цепочки инструментов к запросу выполняется проще и требует всего одного шага большой языковой модели.
По результатам авторов, подход «сначала ответ» позволяет дешевле создавать более сложные, многошаговые данные для работы с инструментами. Модели, обученные на этих данных, превосходят модели, подготовленные базовыми методами, и достигают уровня передовых проприетарных моделей на наборах данных вне распределения — с инструментами, которых не было в обучении.
В традиционном подходе сначала создаётся пользовательский запрос, после чего система ищет для него решение и часто не проходит проверку. ToolGrad сначала строит успешную цепочку вызовов API, а затем создаёт промт, поэтому доля прошедших проверку примеров получается высокой.
Итеративная сборка цепочки инструментов
Обычные системы машинного обучения улучшают модель, вычисляя численные градиенты ошибки на мини-батчах обучающих примеров. Затем алгоритм оптимизации использует эти значения для обновления весов модели.
TextGrad перенёс похожий принцип в оптимизацию промтов. В нём ИИ-критик даёт подробную обратную связь в виде обычного текста. Эти «текстовые градиенты» направляют изменение исходного промта и помогают создать новую версию, которая лучше решает задачу.
ToolGrad применяет ту же идею к генерации синтетических наборов данных. Фреймворк оптимизирует не статичный текстовый промт, а постепенно строит сложные и корректные сценарии работы с API из большой библиотеки инструментов.
Что такое ToolGrad
В ToolGrad четыре основных модуля. Они последовательно предлагают варианты, выполняют вызовы, выбирают результат и обновляют цепочку:
После повторения этого процесса получается пример, включающий пользовательский запрос, проверенную цепочку вызовов API и итоговый ответ ИИ.
ToolGrad сначала создаёт успешную цепочку использования инструментов и только потом формирует промт, поэтому доля успешных примеров получается высокой.
Источник: research.google
Эксперименты
Эффективность генерации данных
Сначала авторы оценили стоимость и качество генерации данных. Для этого они использовали ToolBench как базу API: в ней содержится более 16 тыс. реальных API.
Исследователи сравнили исходный подход «сначала запрос», основанный на поиске в глубину, с подходом ToolGrad «сначала ответ». ToolGrad создал более сложные данные для работы с инструментами, повысил долю успешных примеров и снизил стоимость генерации.
Источник: research.google
Berkeley Function Calling Leaderboard
Исследователи создали небольшие наборы данных ToolGrad-500 на основе API из ToolBench. Затем они дообучили на них модели Gemma-3 размеров 1B, 4B и 12B. Получившиеся модели назвали ToolGrad-1B, ToolGrad-4B и ToolGrad-12B.
Производительность проверили на Berkeley Function Calling Leaderboard (BFCL) — бенчмарке работы с инструментами, где используется другой набор API, не совпадающий с ToolBench. Модели сравнили с тремя группами систем:
Результаты авторы описывают так:
Источник: research.google
Вывод и дальнейшая работа
ToolGrad показывает, что качественные наборы данных для работы с инструментами можно создавать эффективнее и надёжнее, если сначала строить решение, а потом формировать пользовательский запрос. ИИ-агент ToolGrad итеративно соединяет API, используя текстовые градиенты, и таким образом снижает стоимость и ограничения масштабирования при подготовке эталонных данных.
По данным авторов, система достигает почти 100% успешных проверок при генерации данных, позволяет относительно компактным моделям показывать высокие результаты и демонстрирует, что ученическая модель может превзойти модель-учителя.
В дальнейшем исследователи планируют расширить фреймворк для работы с более крупными и динамичными экосистемами API. Они также хотят перенести способность к самоулучшению на непрерывное обучение «на лету» для персонализации со временем.
По мере того как сценарии с ИИ-агентами распространяются в корпоративных и повседневных задачах, такие фреймворки должны помочь создавать цифровых агентов, которые хорошо справляются с задачами и остаются экономичными при развёртывании.
Авторы и участники
Основную часть исследования Чжунъи Чжоу выполнил во время работы приглашённым исследователем в Google.
Авторы поблагодарили за вклад Коhei Уэхару, Хаоюй Чжана, Цзинтао Чжоу, Линь Гу, Чжэн Сюя и Тацуя Хараду, а также за стратегические рекомендации и рецензирование — Адарша Коудла и Шахрама Изади.
Материал относится к темам машинного интеллекта и обработки естественного языка.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram