Запись архива

Поиск как путь к диагнозу: новый метод RCA для долгих цепочек действий AI-агентов

Исследователи представили Continual Search — итеративный фреймворк для автоматического поиска корневых причин сбоев AI-агентов в длинных журналах выполнения. Метод заставляет LLM-судью последовательно искать пропущенные улики, а не довольствоваться первым правдоподобным объяснением. На новом бенчмарке MegaRCA-Mix улучш

Иллюстрация процесса итеративного поиска корневых причин сбоев AI-агентов
Иллюстрация процесса итеративного поиска корневых причин сбоев AI-агентов
File:Envisioning emerging technology for 2012 and beyond.png | by Michell Zappa | openverse | by-sa

На arXiv вышла статья «Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures» (arXiv:2609.13463). Авторы предлагают новый фреймворк Continual Search, который превращает задачу поиска корневых причин сбоев (RCA) AI-агентов в итеративный процесс, а не одноразовый запрос к LLM. Метод показывает значительное улучшение точности, особенно на длинных трейсах, и позволяет менее мощным моделям догнать старших собратьев.

Проблема: RCA как задача поиска
Современные AI-агенты выполняют сложные последовательности действий, генерируя огромные журналы. Когда агент даёт сбой, автоматическое выявление корневой причины — единственный практичный способ исправления ошибок, поскольку ручной анализ журналов непомерно дорог. Существующие методы RCA полагаются на одноразовые суждения LLM: модель смотрит на трейс и сразу выдаёт диагноз. Но на длинных траекториях релевантная информация разрознена, спрятана среди тысяч шагов, и LLM склонна «застревать» на первом правдоподобном объяснении, упуская истинную причину. Авторы формализуют RCA как задачу поиска: нужно не просто оценить трейс, а последовательно находить и проверять недостающие улики.

Метод Continual Search
Continual Search — это итеративный фреймворк, который «подталкивает» LLM-судью на каждом шаге искать новые свидетельства, не замеченные при предыдущем проходе. Работа строится так:
1. Судья анализирует текущий трейс и даёт предварительный диагноз.
2. Фреймворк подсвечивает участки, где не хватает доказательств, и просит судью проверить альтернативы.
3. Процесс повторяется до тех пор, пока не будет накоплено достаточно свидетельств для уверенного вывода.
Такой подход превращает статичный анализ в активный поиск, что критически важно для длинных цепочек действий, где ключевой момент может быть скрыт за десятками шагов от видимого сбоя.

Бенчмарк MegaRCA-Mix
Существующие RCA-бенчмарки оперируют короткими трейсами. Чтобы проверить метод в реалистичных условиях, авторы создали MegaRCA-Mix — набор из 50 вручную размеченных сценариев сбоев в долгих, вычислительно затратных задачах. Каждый сценарий включает развёрнутый журнал выполнения и известную корневую причину, что позволяет объективно оценить качество атрибуции.

Результаты и практическое значение
На нескольких бенчмарках Continual Search стабильно улучшает показатели RCA. Самый впечатляющий результат получен на MegaRCA-Mix: для модели GPT-5.5 F1 вырос с 0,349 до 0,498 — прирост более 40%. При этом авторы отмечают интересный эффект: в рамках одного семейства моделей менее производительные версии, оснащённые Continual Search, могут превзойти более мощные, использующие стандартный одноразовый подход. Это означает, что эффективный поиск важнее чистого масштаба модели — ключевой вывод для практиков, стремящихся снизить затраты на инференс.

Ограничения
Несмотря на прогресс, абсолютная точность остаётся низкой: лучший F1 на MegaRCA-Mix не достигает 0,5. Метод требует настройки критериев остановки поиска и не решает проблему полностью — ошибки всё ещё часты, особенно когда истинная причина лежит за пределами видимых шагов. Авторы позиционируют Continual Search как шаг к более надёжным агентам, а не как финальное решение.

Источники
— Статья на arXiv: https://arxiv.org/abs/2609.13463
— arXiv cs.AI, 15 сентября 2026 г.