Запись архива

Nvidia заявила о сокращении расхода токенов кодинг-агентов до 49% с помощью SoL-Pi

Система SoL-Pi оптимизирует управляющую обвязку кодинг-агента, а не саму языковую модель. На EdgeBench наиболее экономичная конфигурация сократила расход токенов на 49%, сохранив 93,7% базового результата Pi, однако на других тестах выигрыш оказался менее однозначным.

Схема SoL-Pi для оптимизации управляющей обвязки кодинг-агента
Схема SoL-Pi для оптимизации управляющей обвязки кодинг-агента
Изображение из исходного материала

Исследователи Nvidia разработали SoL-Pi — систему, которая автоматически ищет способы сократить затраты кодинг-агентов на уровне управляющей обвязки, или harness. По данным авторов, самая экономичная конфигурация использовала на 49% меньше токенов и получила 93,7% результата базовой системы Pi на бенчмарке EdgeBench.

Это не означает, что любой агент после подключения SoL-Pi станет вдвое дешевле. Результат получен в определённой тестовой конфигурации, а на других наборах задач система иногда уступала исходной обвязке по числу решений. Независимое воспроизведение результатов в публикации The Decoder не описано, поэтому заявленные показатели пока следует рассматривать как результаты экспериментов самих исследователей Nvidia.

Первым о работе подробно сообщил The Decoder: https://the-decoder.com/nvidias-sol-pi-system-cuts-coding-agent-token-usage-nearly-in-half-by-optimizing-the-harness/. Официальный каталог исследовательских работ Nvidia доступен на https://research.nvidia.com/.

SoL-Pi меняет не модель, а логику работы агента

Обвязка кодинг-агента определяет, как языковая модель получает состояние среды, вызывает инструменты, редактирует файлы, запускает тесты и обрабатывает результаты. К этому же слою относятся управление контекстом, проверка действий и условия досрочного завершения задачи.

Именно обвязка превращает обычный запрос к модели в продолжительный агентный процесс. Вместо одного ответа система может многократно читать репозиторий, строить план, менять код, анализировать ошибки и повторять попытку. Каждый цикл добавляет новые токены и вызовы API.

Большинство традиционных методов оптимизации действует на другом уровне: разработчики ускоряют вычисления, квантуют модель, выбирают более дешёвую LLM или сокращают цену обслуживания одного токена. SoL-Pi ищет изменения в последовательности действий агента. Такой подход потенциально позволяет экономить без переобучения основной модели, но создаёт риск удалить из процесса полезный контекст или проверку.

Оптимизировать этот слой вручную сложно: инструменты, история диалога и логика исправления ошибок связаны между собой. Изменение, которое убирает один вызов модели, может привести к дополнительной попытке позднее или снизить вероятность правильного решения.

Поиск охватил 152 направления и более 3000 прогонов

В SoL-Pi один исследовательский агент анализирует траектории другого агента, предлагает изменения в его обвязке и проверяет кандидатов в подготовленных средах. Варианты проходят отбор по двум группам критериев: способности решать задачи и эффективности использования ресурсов.

По информации авторов, система исследовала 152 направления оптимизации в 535 исполняемых средах. В набор вошли 495 задач, собранных из пар GitHub issue и pull request, а также 40 синтетических тестов. Весь поиск потребовал более 3000 прогонов и свыше 60 000 взаимодействий агента со средой.

Отдельное внимание команда уделила переобучению обвязки на задачах поиска. В EdgeBench доступны 51 публичная задача: 11 использовали для однократной проверки готовых кандидатов, а оставшиеся 40 зарезервировали для финальной оценки. По заявлению исследователей, результаты этой оценки не возвращались в цикл оптимизации.

Такое разделение уменьшает риск прямой подгонки под финальные задания, но не доказывает универсальность найденных механизмов. Все публичные задачи одного бенчмарка могут сохранять общие особенности, которых не будет в другом репозитории или рабочем процессе.

Четыре механизма сокращают вызовы и объём контекста

В итоговую систему вошли четыре найденных во время поиска механизма.

Action Fusion объединяет два последовательных действия. Например, агент может внести изменение и сразу запустить тест в рамках одного шага, не обращаясь к языковой модели между этими операциями.

Online Context Compact проверяет накопленный контекст после этапов планирования и сокращает его, если система считает, что существенная информация сохранится.

ObservationPack архивирует длинные результаты работы инструментов. На следующих шагах агент получает сокращённое представление вместо повторной отправки полного вывода.

Evidence-Preserving Reducer передаёт объёмные журналы тестов и ошибок более дешёвой модели, которая выделяет основные факты. Дополнительная автоматическая проверка должна обнаруживать важные сведения, потерянные при сокращении.

Все четыре механизма воздействуют на разные источники расходов: число обращений к модели, длину входного контекста и обработку больших логов. Одновременно они создают общий риск — агент может не увидеть деталь, которая окажется критичной на следующем шаге.

Экономия зависит от выбранного режима

На 51 публичной задаче EdgeBench конфигурация со всеми четырьмя механизмами сократила расход токенов на 49%, но сохранила 93,7% базового результата Pi. Иными словами, максимальная экономия сопровождалась некоторым снижением итогового показателя.

Другой вариант, использовавший только наиболее эффективный отдельный механизм, превысил результат Pi на 5,3% и также потребовал меньше токенов. В зависимости от конфигурации общее сокращение составило от 44,7 до 49%.

Авторы оценили экономию относительно штатных обвязок Codex и Claude Code в $8,75–13,50 за час работы агента. По сравнению с Pi расчётная разница составила $4,36–5,71 в час. Эти суммы зависят от моделей, объёма кэшированного контекста и тарифов API. Для пересчёта под собственную нагрузку разработчикам следует сверять актуальные цены OpenAI на https://openai.com/api/pricing/ и Anthropic на https://www.anthropic.com/pricing/, а не переносить оценки исследования напрямую в бюджет проекта.

В одном из экспериментов сокращение токенов уменьшило общий счёт с $1339 до $894, хотя более короткий контекст способен снизить выгоду от кэширования промптов. Поэтому количество токенов и фактическая стоимость не всегда меняются в одинаковой пропорции.

На других моделях и задачах результат слабее

SoL-Pi создавалась на траекториях GPT-5.6 Sol. После переноса на Opus 5 без дополнительной настройки система сохранила 94,3% результата Pi при сопоставимой экономии. Однако оптимизирующие механизмы включались реже и действовали менее агрессивно. Авторы связывают это с тем, что поиск проводился только на поведении GPT-5.6 Sol.

За пределами EdgeBench картина оказалась смешанной. На 63 процессорных задачах Terminal-Bench 4 SoL-Pi решила 15 заданий, тогда как Codex и Pi — по 18. Затраты SoL-Pi при этом были примерно на четверть ниже, но экономия сопровождалась уменьшением числа решений.

На формально проверяемых задачах Lean 4, связанных с Математической олимпиадой 2026 года, система справилась с тремя из шести заданий и показала наименьшую стоимость одного решения. В отдельном эксперименте по оптимизации вычислительных ядер группа из 20 агентов SoL-Pi сократила затраты на 26,8% относительно сопоставимой группы Pi.

Для команд, тестирующих подобный подход, практический критерий — не расход токенов сам по себе, а стоимость успешно принятого изменения. Сравнивать конфигурации стоит на собственных репозиториях по доле решённых задач, числу повторных попыток, прохождению тестов, времени выполнения и итоговому счёту API. Результат EdgeBench пока не подтверждает, что сокращение контекста будет одинаково безопасным для крупных кодовых баз, редких инструментов или длинных сессий с многочисленными требованиями пользователя.

Источники