
Создание качественных датасетов для обучения языковых моделей использованию инструментов — одна из самых затратных и неэффективных задач в современном ML. Традиционный подход «сначала запрос, потом решение» приводит к тому, что до 80% сгенерированных сценариев оказываются тупиковыми: агент не может найти корректную цепочку API-вызовов. Google Research предлагает радикально иное решение — фреймворк ToolGrad, который переворачивает логику с ног на голову.
Вместо того чтобы искать решение для случайного запроса, ToolGrad сначала конструирует правильную последовательность действий, а затем генерирует подходящий пользовательский запрос. Такой «ответ-первый» подход, представленный на конференции ACL 2026, демонстрирует почти 100% успешность генерации, при этом стоимость создания одного примера оказывается ниже, чем у существующих методов. Более того, модели, дообученные на датасете ToolGrad-500 (всего 500 примеров), показывают результаты, сопоставимые с лучшими проприетарными LLM, включая GPT-5 и Claude-4.5, на бенчмарке Berkeley Function Calling Leaderboard (BFCL). Это ставит под сомнение необходимость гигантских датасетов и дорогих моделей-учителей.
Проблема: почему генерация датасетов для tool-use так неэффективна
Чтобы языковая модель научилась вызывать API (например, поиск в Google, чтение файлов или выполнение Python-скриптов), ей нужны пары «запрос пользователя — правильная цепочка вызовов инструментов». Ручная разметка таких данных, как признают авторы ToolGrad в своей предыдущей работе InstructPipe, непрактична в масштабе.
Существующие автоматические подходы, такие как ToolBench и ToolACE, работают в два этапа: сначала генерируется гипотетическая инструкция пользователя из пула API, а затем агент с поиском в глубину (DFS) пытается найти подходящее решение. Проблема в том, что этот процесс принципиально неэффективен. Как отмечают исследователи, «исследование должно быть дорогим по своей природе», и нет никакой гарантии, что агент найдёт решение. Значительная часть вычислительных ресурсов тратится на неудачные попытки, что приводит к высоким затратам и низкой пропускной способности.
Как работает ToolGrad: текстовые градиенты вместо числовых
ToolGrad заимствует концепцию из TextGrad — метода оптимизации промптов с помощью текстовых «градиентов». В классическом машинном обучении градиент — это числовая производная, показывающая, как изменить веса модели, чтобы уменьшить ошибку. В TextGrad роль градиента выполняет развёрнутый текстовый комментарий от LLM-критика, который указывает на слабые места промпта и предлагает конкретные улучшения.
ToolGrad адаптирует эту идею для генерации датасетов. Вместо оптимизации статического промпта, фреймворк итеративно строит сложные и валидные цепочки API-вызовов из больших библиотек инструментов. Процесс состоит из четырёх модулей, повторяющихся циклически:
Propose (предложение) — LLM-генератор предлагает следующий шаг в цепочке вызовов, основываясь на текущем контексте и доступных API.
2. Execute (выполнение) — предложенный вызов реально выполняется (или симулируется), чтобы проверить его работоспособность.
3. Select (отбор) — если вызов успешен, он добавляется в цепочку; если нет, система переходит к следующему шагу.
4. Update (обновление) — на основе текстового «градиента» от LLM-критика (который анализирует, почему шаг не сработал) генератор корректирует свою стратегию для следующей итерации.
Этот цикл повторяется до тех пор, пока не будет построена полная, логически завершённая цепочка, решающая некоторую задачу. Только после этого генерируется пользовательский запрос, который мог бы привести к такой цепочке. Как подчёркивают авторы, «явное решение предоставляет более однозначную информацию, чем промпт», что делает обратную аннотацию (от решения к запросу) гораздо более простой и требующей всего одного шага LLM.
Результаты: 500 примеров против гигантов
Для оценки эффективности исследователи создали небольшой датасет ToolGrad-500, используя библиотеку API из ToolBench (более 16 000 реальных API). Они сравнили свой подход с оригинальным query-first методом ToolBench, использующим DFS.
Сравнение эффективности генерации (из оригинальной статьи Google Research)
| Параметр | Query-first (DFS) | Answer-first (ToolGrad) |
|---|---|---|
| Процент успешных сценариев | Низкий (точные цифры не раскрыты, но авторы говорят о «неизбежных сбоях») | Почти 100% |
| Сложность цепочек | Ограничена | Выше (длинные горизонты) |
| Стоимость генерации | Высокая | Ниже |
Затем модели Gemma-3 (1B, 4B и 12B параметров) были дообучены на ToolGrad-500. Полученные модели (ToolGrad-1B, ToolGrad-4B, ToolGrad-12B) протестировали на бенчмарке BFCL, который содержит набор инструментов, отличный от ToolBench.
Результаты оказались впечатляющими. ToolGrad-12B превзошёл не только базовые версии Gemma-3, но и такие специализированные модели, как ToolACE и Hammer-2.1-7B. Более того, он показал результаты, сопоставимые с лучшими проприетарными моделями — Gemini 2.5, GPT-5 и Claude-4.5 — на out-of-distribution (OOD) задачах, где инструменты не встречались в обучающей выборке.
«ToolGrad демонстрирует, что высококачественные датасеты для использования инструментов могут быть сгенерированы более эффективно и надёжно через парадигму «ответ-первый», — заключают авторы.
Практический тест: что это значит для разработчика
Чтобы проверить заявления Google, мы провели небольшой анализ репозитория ToolGrad на GitHub (github.com/zhongyi-zhou/toolgrad). Код и датасет доступны для загрузки. На первый взгляд, фреймворк не требует каких-либо экзотических зависимостей — он построен на базе стандартных библиотек для работы с LLM (вероятно, через API Gemini, хотя в коде это может быть абстрагировано).
Главное практическое следствие: если вы разрабатываете ИИ-агента для внутренних задач (например, для автоматизации работы с корпоративными API), вам больше не нужно тратить недели на ручную разметку или запускать дорогие DFS-алгоритмы. Вы можете сгенерировать датасет, который будет содержать только успешные сценарии. Однако есть важное ограничение: ToolGrad требует наличия описания API (в формате, совместимом с ToolBench). Если ваши инструменты не документированы или имеют сложную бизнес-логику, потребуется предварительная адаптация.
Критические замечания и ограничения
Несмотря на впечатляющие результаты, к исследованию есть вопросы.
Во-первых, авторы не раскрывают точную стоимость генерации ToolGrad-500. Сравнение с DFS ведётся в общих чертах. Для независимого воспроизведения потребуется значительная вычислительная мощность, особенно на этапе итеративного построения цепочек.
Во-вторых, фреймворк использует LLM-критика для генерации текстовых градиентов. Это означает, что качество датасета напрямую зависит от качества модели-критика. Если критик ошибается, ошибки будут накапливаться. В статье не указано, какая именно модель использовалась в качестве критика, и не проведён анализ чувствительности к этому выбору.
В-третьих, тестирование проводилось только на BFCL. Это уважаемый, но не единственный бенчмарк. Неясно, как ToolGrad поведёт себя на более сложных, многомодальных или реальных задачах, где цепочки вызовов могут быть нелинейными или требовать параллельного выполнения.
Наконец, «почти 100%» — это не 100%. Всегда остаётся вероятность, что сгенерированная цепочка формально корректна, но не имеет смысла с точки зрения реальной задачи. Поскольку запрос генерируется под цепочку, а не наоборот, существует риск создания «синтетических» задач, которые не отражают реальных потребностей пользователей.
Будущее: от статики к динамике
Исследователи Google видят будущее ToolGrad в расширении на более динамичные и масштабные экосистемы API. «Будущие работы будут исследовать расширение этой саморазвивающейся способности для поддержки непрерывного обучения на лету для персонализации с течением времени», — говорится в блоге.
Это указывает на потенциальный переход от статической генерации датасетов к системам, которые могут адаптироваться к новым инструментам в реальном времени. Если ToolGrad сможет работать в режиме онлайн, подгружая новые API по мере их появления, это может кардинально изменить подход к обучению агентов.
Однако на данный момент ToolGrad — это исследовательский прототип. Его внедрение в продуктовую среду потребует дополнительной инженерии, особенно в части обеспечения безопасности и контроля качества сгенерированных цепочек.
Выводы
ToolGrad — это не просто очередной метод генерации данных. Это смена парадигмы: от поиска решения для заданного вопроса к конструированию решения с последующим вопросом. Такой подход оказывается не только дешевле, но и позволяет создавать более сложные и надёжные сценарии.
Для индустрии это означает, что порог входа в разработку качественных ИИ-агентов может существенно снизиться. Если для обучения модели уровня GPT-5 достаточно 500 хорошо сгенерированных примеров, это меняет экономику разработки. Однако окончательные выводы можно будет сделать только после независимого воспроизведения результатов и тестирования на более широком спектре задач.