i
ДАТАИСТ
Новости · 2026-09-10

ToolGrad: датасеты для работы с инструментами генерируют с «текстовыми градиентами»

@neuronium_ai @neuronium_ai

Исследователи Google Чжунъи Чжоу и Руофэй Ду представили на ACL 2026 фреймворк ToolGrad для автоматической генерации наборов данных, обучающих ИИ-агентов работе с инструментами. В отличие от распространённого подхода, система сначала строит успешную цепочку вызовов API, а затем создаёт под неё пользовательский запрос. Это снижает стоимость подготовки данных, повышает долю успешных примеров и позволяет формировать более сложные многошаговые сценарии. Обученная на таких данных модель ToolGrad-12B получила 83,1 балла в тесте Berkeley Function Calling Leaderboard — почти столько же, сколько Gemini-2.5-pro с 83,2 балла.

Обложка: ToolGrad: датасеты для работы с инструментами генерируют с «текстовыми градиентами»

Источник: research.google

ИИ-агенты уже умеют автоматизировать практические задачи: выполнять поиск в Google, читать локальные файлы на компьютере и запускать сгенерированные скрипты на Python. Чтобы такие сценарии работали, большие языковые модели должны правильно и эффективно пользоваться инструментами.

Для обучения нужны наборы данных с цепочками вызовов инструментов и соответствующими пользовательскими запросами. В предыдущей работе авторы вручную размечали тестовые данные, но такой подход невозможно масштабировать для обучения современных ИИ-моделей.

ToolBench и ToolACE предложили автоматизировать подготовку данных с помощью агента, который методом проб и ошибок ищет путь использования инструментов. В этом подходе:

1из набора API выбирается группа инструментов, на основе которой создаётся гипотетическая инструкция пользователя;
2агент с поиском в глубину находит решение задачи через вызовы инструментов.

Такая схема неэффективна: ей приходится извлекать полезные последовательности действий из сложного процесса исследования, чтобы затем использовать их для обучения модели.

В работе «ToolGrad: Efficient Tool-use Dataset Generation with Textual “Gradients”», представленной на ACL 2026, исследователи описали другой принцип. ToolGrad сначала создаёт эталонную цепочку вызовов инструментов, а затем формирует соответствующий пользовательский промт. Готовое решение содержит более однозначную информацию, чем исходный запрос, поэтому переход от цепочки инструментов к запросу выполняется проще и требует всего одного шага большой языковой модели.

По результатам авторов, подход «сначала ответ» позволяет дешевле создавать более сложные, многошаговые данные для работы с инструментами. Модели, обученные на этих данных, превосходят модели, подготовленные базовыми методами, и достигают уровня передовых проприетарных моделей на наборах данных вне распределения — с инструментами, которых не было в обучении.

В традиционном подходе сначала создаётся пользовательский запрос, после чего система ищет для него решение и часто не проходит проверку. ToolGrad сначала строит успешную цепочку вызовов API, а затем создаёт промт, поэтому доля прошедших проверку примеров получается высокой.

Итеративная сборка цепочки инструментов

Обычные системы машинного обучения улучшают модель, вычисляя численные градиенты ошибки на мини-батчах обучающих примеров. Затем алгоритм оптимизации использует эти значения для обновления весов модели.

TextGrad перенёс похожий принцип в оптимизацию промтов. В нём ИИ-критик даёт подробную обратную связь в виде обычного текста. Эти «текстовые градиенты» направляют изменение исходного промта и помогают создать новую версию, которая лучше решает задачу.

ToolGrad применяет ту же идею к генерации синтетических наборов данных. Фреймворк оптимизирует не статичный текстовый промт, а постепенно строит сложные и корректные сценарии работы с API из большой библиотеки инструментов.

1Предложить API
2Выполнить вызовы
3Выбрать результат
4Обновить запрос

Что такое ToolGrad

В ToolGrad четыре основных модуля. Они последовательно предлагают варианты, выполняют вызовы, выбирают результат и обновляют цепочку:

1API Proposer на каждой итерации сужает случайно выбранный набор API до нескольких подходящих кандидатов, которыми можно продолжить текущий сценарий.
2API Executors параллельно проверяют выбранные API и создают подробные отчёты о выполнении.
3API Selector анализирует отчёты и выбирает один наиболее удачный вызов API. Он работает как текстовый градиент: задаёт направление для следующего улучшения и добавляет выбранный вызов в цепочку.
4LLM Updater обновляет синтетический пользовательский запрос и ответ ИИ так, чтобы они соответствовали новому набору API.

После повторения этого процесса получается пример, включающий пользовательский запрос, проверенную цепочку вызовов API и итоговый ответ ИИ.

ToolGrad сначала создаёт успешную цепочку использования инструментов и только потом формирует промт, поэтому доля успешных примеров получается высокой.

Источник: research.google

Эксперименты

Эффективность генерации данных

Сначала авторы оценили стоимость и качество генерации данных. Для этого они использовали ToolBench как базу API: в ней содержится более 16 тыс. реальных API.

Исследователи сравнили исходный подход «сначала запрос», основанный на поиске в глубину, с подходом ToolGrad «сначала ответ». ToolGrad создал более сложные данные для работы с инструментами, повысил долю успешных примеров и снизил стоимость генерации.

Подход «сначала запрос»поиск решения после создания запроса
ToolGradуспешная цепочка до создания запроса

Источник: research.google

Berkeley Function Calling Leaderboard

Исследователи создали небольшие наборы данных ToolGrad-500 на основе API из ToolBench. Затем они дообучили на них модели Gemma-3 размеров 1B, 4B и 12B. Получившиеся модели назвали ToolGrad-1B, ToolGrad-4B и ToolGrad-12B.

Производительность проверили на Berkeley Function Calling Leaderboard (BFCL) — бенчмарке работы с инструментами, где используется другой набор API, не совпадающий с ToolBench. Модели сравнили с тремя группами систем:

базовыми моделями без дообучения;
передовыми проприетарными моделями Gemini, GPT и Claude;
специализированными моделями для работы с инструментами ToolACE и Hammer-2.1-7B.

Результаты авторы описывают так:

Улучшение относительно базовых моделей. Дообучение Gemma-3 на ToolGrad-500 заметно повысило качество работы с инструментами для всех проверенных размеров модели.
Сопоставимость с проприетарными моделями. ToolGrad-12B получила 83,1 балла. Это близко к результатам наиболее продвинутых на момент публикации проприетарных моделей: gemini-2.5-pro — 83,2, claude-4.5 Opus — 82,8, gpt-5 — 74,4.
Самоулучшение. Набор ToolGrad-500 создали с помощью gemini-2.5-flash-lite. При этом Gemma-3-12B, дообученная на данных от gemini-2.5-flash-lite, показала результат выше исходной модели-«учителя».
Преимущество над другими открытыми моделями. ToolGrad-12B заметно опередила другие открытые специализированные модели для работы с инструментами, включая ToolACE, которую дообучали на более продвинутой базе API.
83,1ToolGrad-12B
83,2gemini-2.5-pro
82,8claude-4.5 Opus
74,4gpt-5

Источник: research.google

Вывод и дальнейшая работа

ToolGrad показывает, что качественные наборы данных для работы с инструментами можно создавать эффективнее и надёжнее, если сначала строить решение, а потом формировать пользовательский запрос. ИИ-агент ToolGrad итеративно соединяет API, используя текстовые градиенты, и таким образом снижает стоимость и ограничения масштабирования при подготовке эталонных данных.

По данным авторов, система достигает почти 100% успешных проверок при генерации данных, позволяет относительно компактным моделям показывать высокие результаты и демонстрирует, что ученическая модель может превзойти модель-учителя.

В дальнейшем исследователи планируют расширить фреймворк для работы с более крупными и динамичными экосистемами API. Они также хотят перенести способность к самоулучшению на непрерывное обучение «на лету» для персонализации со временем.

По мере того как сценарии с ИИ-агентами распространяются в корпоративных и повседневных задачах, такие фреймворки должны помочь создавать цифровых агентов, которые хорошо справляются с задачами и остаются экономичными при развёртывании.

Авторы и участники

Основную часть исследования Чжунъи Чжоу выполнил во время работы приглашённым исследователем в Google.

Авторы поблагодарили за вклад Коhei Уэхару, Хаоюй Чжана, Цзинтао Чжоу, Линь Гу, Чжэн Сюя и Тацуя Хараду, а также за стратегические рекомендации и рецензирование — Адарша Коудла и Шахрама Изади.

Материал относится к темам машинного интеллекта и обработки естественного языка.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram