Harnessed Agentic RL: обучение ИИ-агента в его рабочей оболочке

Microsoft Research описывает Harnessed Agentic RL как обучение с участием рабочего harness агента. Разбираем прокси Agent Lightning v1.0 и заявленный результат на SWE-bench Verified с оговоркой об отсутствии независимой проверки в доступных материалах.

Harnessed Agentic RL: обучение ИИ-агента в его рабочей оболочке. Тематическая карточка Comrad404.

В обычной для описанной Microsoft Research схемы обучения с подкреплением тренировочная система управляет циклом взаимодействия агента со средой. В Harnessed Agentic RL этот цикл остаётся в harness — программной обвязке, которая управляет контекстом, вызовами инструментов и действиями агента. Разберём, как Microsoft Research описывает эту идею на примере Agent Lightning v1.0 и какие результаты приводит.

Что означает Harnessed Agentic RL

Harness — не отдельная модель, а код, который организует работу агента: управляет контекстом, вызовами инструментов и выполнением действий. Harnessed Agentic RL — подход к обучению с подкреплением, при котором рабочий цикл этого агента участвует в обучении. По описанию Microsoft Research, разработчикам не нужно заново реализовывать цикл внутри тренировочного фреймворка.

Обучение с подкреплением, или RL, — способ улучшать поведение системы по результатам её действий и получаемой награды. В агентной системе имеет значение не только используемая модель, но и то, как окружающий её код управляет инструментами и передаёт контекст. В блоге Microsoft Research Harnessed Agentic RL описан как обучение, в котором участвует тот же harness, что используется при развёртывании.

Чем отличается традиционный цикл обучения

В традиционной схеме, которую описывают авторы, тренировочная система управляет взаимодействием модели со средой: модель выдаёт действие, среда возвращает наблюдение, его добавляют в контекст, после чего модель формирует следующий шаг. Чтобы обучать конкретного агента, его цикл приходится воспроизводить внутри фреймворка.

Это может потребовать дополнительной работы и привести к расхождению между обучаемой и развёрнутой версиями агента. Microsoft Research противопоставляет этому подход, где цикл остаётся под управлением harness. Это описание архитектурного различия, а не доказательство того, что новый вариант проще или даёт лучшие результаты во всех случаях.

Пример: существующий агент через прокси

Представьте программного агента, который читает задачу, вызывает инструменты и проверяет изменения в коде. В Agent Lightning v1.0 между ним и языковой моделью ставится прокси. Согласно публикации, запросы, которые прежде шли к API модели, можно направить на прокси: агент продолжает работать в своём harness, а тренировочная система наблюдает и записывает обращения к модели.

Такой посредник связывает существующий рабочий цикл с обучением, не требуя переписывать сам harness. Это не означает, что тренировка обходится без адаптации или дополнительных технических решений: авторы упоминают, в частности, сложности обработки данных, когда обращения к модели разбиваются на несколько частей.

Размер фреймворка — оценка авторов

Microsoft Research сообщает, что Agent Lightning v1.0 состоит примерно из 3500 строк кода и включает систему управления обучением с Harnessed Agentic RL. Это оценка разработчиков, а не независимая проверка размера, полноты или удобства фреймворка. Небольшое число строк само по себе не говорит о требованиях к инфраструктуре и не доказывает, что систему легко освоить.

Результат на SWE-bench Verified и его пределы

В опубликованном Microsoft Research примере для модели Qwen3.5-9B показатель Pass@1 на SWE-bench Verified вырос с 41,8% до 56,4% после обучения примерно на 6000 выборках. Разница между значениями — 14,6 процентного пункта. Это цифры из описанного авторами эксперимента, а не результат независимого тестирования редакцией.

По имеющимся материалам нельзя независимо подтвердить эксперимент или заключить, что такой же прирост будет на других моделях и задачах. Описание эксперимента и показателя Pass@1 опубликовано в блоге компании.

Что сообщают о поддержке Kubernetes

Microsoft Research заявляет о поддержке Kubernetes: агенты могут запускаться как стандартные Kubernetes jobs, в том числе на собственных кластерах, в облачных Kubernetes-средах и локальной инфраструктуре. В проверенной публикации нет независимых результатов, которые позволяли бы оценить масштабирование системы в этих условиях.

Таким образом, в описанной Microsoft Research архитектуре при обучении сохраняется управляющий цикл рабочего harness, а прокси связывает его с моделью и системой обучения. Источник сообщает об одном эксперименте на SWE-bench Verified и о поддержке Kubernetes; независимо проверить воспроизводимость этих результатов по одной корпоративной публикации нельзя.