Запись архива

LLM-агенты получат систему предварительной верификации: новый подход к предотвращению «тихих» ошибок

Исследователи предлагают проверять действия LLM-агента до их выполнения, чтобы избежать «тихих» ошибок. Метод показал 95,8% точности для shell-команд и снизил частоту молчаливых сбоев при редактировании кода до 0,01%.

Схема работы системы предварительной верификации действий LLM-агента
Схема работы системы предварительной верификации действий LLM-агента
File:Envisioning emerging technology for 2012 and beyond.png | by Michell Zappa | openverse | by-sa

Исследователи представили новый подход к контролю действий LLM-агентов — систему предварительной верификации, которая проверяет корректность действия до его фактического выполнения. Работа «Look Before You Leap: Pre-Action Verification for LLM Agents» опубликована на arXiv и предлагает решение проблемы «тихих» ошибок — ситуаций, когда агент выполняет действие, которое выглядит правдоподобно, но приводит к неверному результату без генерации явной ошибки.

Как работает система
Основная идея — зафиксировать корректный эффект действия до того, как исполнитель (executor) его выполнит. Верификатор может воздержаться от оценки, если не уверен в результате, вместо того чтобы гадать. Это позволяет превратить «тихие» ошибки в восстанавливаемые — агент получает шанс исправить действие до того, как оно повлияет на систему.

Тестирование на shell-командах
Для shell-команд исследователи создали статический верификатор, протестированный на 9930 командах и 482 инструментах. Результаты:
— Синтаксические и бинарные проверки (проверка существования команды) работают с нулевым уровнем ложных срабатываний и ловят половину всех ошибок.
— Проверка флагов команд ограничена покрытием help-текста и отвечает за все ложные срабатывания.
— Общая точность: 95,8% выявленных невалидных команд при 10,0% ложных срабатываний.

Редактирование кода: ключевое различие
Для тестирования операций редактирования кода был создан бенчмарк из 640 правок в 224 файлах. Результаты выявили принципиальное различие между форматами:
— Форматы с привязкой к содержимому (search/replace, diff) завершаются с явной ошибкой при несовпадении контекста.
— Форматы с привязкой к местоположению (номера строк, имена функций) приводят к «тихим» ошибкам: сдвиг на одну строку портит 99,1% файлов, а редактирование по имени функции попадает не в ту функцию в 12,7% случаев.

Практические результаты
Применение политики «отказ при неуверенности» позволяет снизить количество «тихих» ошибок до управляемого уровня:
— Селективное ограничение (selective grounding) достигает 0,958 полноты при 7,0% ложных срабатываний.
— Метод «привязка и верификация» (anchor-and-verify) зафиксировал всего одно неявное ошибочное применение на 8320 попыток (0,01%).

Ограничения подхода
Метод не универсален: верификатор может только проверять статически известные свойства действий. Для shell-команд точность ограничена качеством help-текстов и документации. Для редактирования кода подход требует, чтобы формат правки поддерживал привязку к содержимому, что не всегда возможно в существующих инструментах.

Источники
— Оригинальная статья: arXiv:2609.11957 — «Look Before You Leap: Pre-Action Verification for LLM Agents» (https://arxiv.org/abs/2609.11957)
— Платформа arXiv: https://arxiv.org/