
Исследователи из проекта HARNESSEVO опубликовали на arXiv препринт, в котором ставят под сомнение распространённую практику оптимизации «обвязки» (harness) замороженных LLM-агентов как одной плоской текстовой строки. Основной результат — почти весь прирост от эволюции обвязки приходится на единственный слот рефлексии и контроля, а равномерное распределение вычислительного бюджета между слотами не просто неэффективно, а активно вредит.
Как устроен HARNESSEVO
Авторы декомпозировали текстовую обвязку агента на четыре слота: роль агента (role), стратегию задачи (task-strategy), правила формата и инструментов (tool/format-rules) и блок рефлексии с управляющими эвристиками (reflection/control). Каждый слот эволюционирует отдельно. Эксперименты проводились на среде ALFWorld с замороженной моделью на 7 млрд параметров при фиксированном общем бюджете вычислительных роллаутов.
Сравнение с плоской эволюцией не показало статистически значимого улучшения общего показателя бинарного успеха: 0,657 против 0,642 у стоковой обвязки и 0,642 у плоской эволюции. Однако слот-уровневый анализ вскрыл картину, которую плоский подход маскирует.
Большая часть выигрыша локализована
Метрика leave-one-in (изоляция одного слота) показала, что только слот рефлексии и контроля даёт значимый положительный вклад — +0,119 к успешности. Остальные три слота индивидуально дают нулевой прирост. Иными словами, оптимизационная ценность сосредоточена не в формулировке роли, не в расписывании стратегии и не в правилах формата, а в механизме, который агент использует для рефлексии собственных действий и коррекции курса.
Ловушка равномерного деления бюджета
Ключевой практический вывод — равномерное распределение бюджета между слотами (например, 64 роллаута на четыре слота, по 16 на каждый) попадает в ловушку budget-splitting trap. При 16 роллаутах на слот оптимизатор не достигает эффективного порога поиска, и каждый слот застывает в пустом seed-состоянии. Концентрация того же бюджета на одном зарекомендовавшем себя слоте рефлексии позволяет восстановить потерянный выигрыш и поднять успешность до 0,761 — при вдвое меньшем общем числе роллаутов (32 против 64).
Зависимость от задачи
Эффект оказался task-контингентным. На среде WebShop все четыре слота застыли пустыми, а все методы показали одинаковый результат. Авторы интерпретируют это как отсутствие recurrent, verbalizable control failures — то есть в WebShop просто нет повторяющихся вербализуемых сбоев управления, которые могла бы исправить эволюция обвязки. Это не проблема нехватки бюджета, а фундаментальное отсутствие объекта для оптимизации.
Что это значит для разработчиков агентов
Результаты указывают на необходимость предварительного кредитного присваивания (credit assignment) перед структурированной эволюцией агента. Вместо того чтобы эволюционировать всю подсказку целиком и равномерно тратить ресурсы на все компоненты, имеет смысл сначала локализовать, какой именно слой обвязки ответственен за наблюдаемые сбои, и направить бюджет только на него.
Ограничения работы
Эксперименты выполнены на одной модели (7B) и двух средах. Выводы о «нулевости» остальных слотов могут не обобщаться на более крупные модели или задачи, где роль, стратегия и формат действительно играют самостоятельную роль. Кроме того, декомпозиция на четыре слота — один из возможных способов дробления обвязки, и иная схема разбиения может дать другую картину.
Источники
Оригинальная статья на arXiv: 2609.02889 (https://arxiv.org/abs/2609.02889)
Верификация: https://arxiv.org/
