
Исследователи из академических кругов и индустрии опубликовали препринт, в котором предлагают два новых метода оценки уверенности агентных систем на основе внутренних представлений модели. Работа выложена на arXiv под идентификатором 2609.09448.
Суть проблемы
В отличие от классических ML-систем, агентные воркфлоу имеют сложные сценарии отказов: ошибки планирования, некорректный вызов инструментов и взаимодействие с динамической средой. Традиционные методы калибровки, основанные на поверхностных уровнях генерации текста или последовательностях действий, часто не дают надежной оценки вероятности успеха. В критически важных приложениях это может приводить к небезопасным решениям.
Методы LTD и ARP
Авторы вводят две взаимодополняющие техники. Latent Trajectory Dynamics (LTD) анализирует изменения в residual-stream представлениях на протяжении всей траектории взаимодействия. Action Representation Probe (ARP) предсказывает успех на основе представлений, формирующихся в момент принятия решений. Оба метода не требуют дополнительных вычислительных затрат — ни изменения промптов, ни многократных прогонов.
Экспериментальные результаты
Методы протестированы на трех интерактивных бенчмарках: Bash, SQL и Python. В качестве базовых моделей использовались Qwen 14B, Qwen 7B и DeepSeek 6.7B. LTD и ARP стабильно превосходят baseline-методы калибровки, основанные на поверхностной генерации текста и анализе последовательностей. Авторы подчеркивают, что предложенный подход обеспечивает мониторинг надежности без увеличения накладных расходов.
Практическое значение
Для разработчиков агентных систем это означает возможность встраивать индикатор уверенности прямо в пайплайн, не замедляя работу. Если агент не уверен в успехе, можно приостановить выполнение, запросить уточнение или передать управление человеку. Особенно важно для сценариев, где ошибка стоит дорого: управление кодом, выполнение SQL-запросов в продакшене или автоматизация рабочих процессов.
Ограничения и вопросы
Работа находится на стадии препринта и требует дополнительной валидации на более широком спектре моделей и задач. Нет данных о том, как методы ведут себя при распределенной обработке или в режиме реального времени. Кроме того, остается открытым вопрос о применимости к моделям со значительно большим числом параметров (более 70B). Пока не ясно, насколько устойчивы LTD и ARP к adversarial input и дрейфу данных.
Источники
Оригинальная публикация на arXiv: https://arxiv.org/abs/2609.09448 (препринт от 11 сентября 2026 года).
