В обычной для описанной Microsoft Research схемы обучения с подкреплением тренировочная система управляет циклом взаимодействия агента со средой. В Harnessed Agentic RL этот цикл остаётся в harness — программной обвязке, которая управляет контекстом, вызовами инструментов и действиями агента. Разберём, как Microsoft Research описывает эту идею на примере Agent Lightning v1.0 и какие результаты приводит.
Что означает Harnessed Agentic RL
Harness — не отдельная модель, а код, который организует работу агента: управляет контекстом, вызовами инструментов и выполнением действий. Harnessed Agentic RL — подход к обучению с подкреплением, при котором рабочий цикл этого агента участвует в обучении. По описанию Microsoft Research, разработчикам не нужно заново реализовывать цикл внутри тренировочного фреймворка.
Обучение с подкреплением, или RL, — способ улучшать поведение системы по результатам её действий и получаемой награды. В агентной системе имеет значение не только используемая модель, но и то, как окружающий её код управляет инструментами и передаёт контекст. В блоге Microsoft Research Harnessed Agentic RL описан как обучение, в котором участвует тот же harness, что используется при развёртывании.
Чем отличается традиционный цикл обучения
В традиционной схеме, которую описывают авторы, тренировочная система управляет взаимодействием модели со средой: модель выдаёт действие, среда возвращает наблюдение, его добавляют в контекст, после чего модель формирует следующий шаг. Чтобы обучать конкретного агента, его цикл приходится воспроизводить внутри фреймворка.
Это может потребовать дополнительной работы и привести к расхождению между обучаемой и развёрнутой версиями агента. Microsoft Research противопоставляет этому подход, где цикл остаётся под управлением harness. Это описание архитектурного различия, а не доказательство того, что новый вариант проще или даёт лучшие результаты во всех случаях.
Пример: существующий агент через прокси
Представьте программного агента, который читает задачу, вызывает инструменты и проверяет изменения в коде. В Agent Lightning v1.0 между ним и языковой моделью ставится прокси. Согласно публикации, запросы, которые прежде шли к API модели, можно направить на прокси: агент продолжает работать в своём harness, а тренировочная система наблюдает и записывает обращения к модели.
Такой посредник связывает существующий рабочий цикл с обучением, не требуя переписывать сам harness. Это не означает, что тренировка обходится без адаптации или дополнительных технических решений: авторы упоминают, в частности, сложности обработки данных, когда обращения к модели разбиваются на несколько частей.
Размер фреймворка — оценка авторов
Microsoft Research сообщает, что Agent Lightning v1.0 состоит примерно из 3500 строк кода и включает систему управления обучением с Harnessed Agentic RL. Это оценка разработчиков, а не независимая проверка размера, полноты или удобства фреймворка. Небольшое число строк само по себе не говорит о требованиях к инфраструктуре и не доказывает, что систему легко освоить.
Результат на SWE-bench Verified и его пределы
В опубликованном Microsoft Research примере для модели Qwen3.5-9B показатель Pass@1 на SWE-bench Verified вырос с 41,8% до 56,4% после обучения примерно на 6000 выборках. Разница между значениями — 14,6 процентного пункта. Это цифры из описанного авторами эксперимента, а не результат независимого тестирования редакцией.
По имеющимся материалам нельзя независимо подтвердить эксперимент или заключить, что такой же прирост будет на других моделях и задачах. Описание эксперимента и показателя Pass@1 опубликовано в блоге компании.
Что сообщают о поддержке Kubernetes
Microsoft Research заявляет о поддержке Kubernetes: агенты могут запускаться как стандартные Kubernetes jobs, в том числе на собственных кластерах, в облачных Kubernetes-средах и локальной инфраструктуре. В проверенной публикации нет независимых результатов, которые позволяли бы оценить масштабирование системы в этих условиях.
Таким образом, в описанной Microsoft Research архитектуре при обучении сохраняется управляющий цикл рабочего harness, а прокси связывает его с моделью и системой обучения. Источник сообщает об одном эксперименте на SWE-bench Verified и о поддержке Kubernetes; независимо проверить воспроизводимость этих результатов по одной корпоративной публикации нельзя.










