Запись архива

SearchAuditor: как находить и исправлять сбои длинных поисковых агентов

На arXiv вышел препринт SearchAuditor: авторы представили бенчмарк SearchAuditBench и фреймворк для локализации, атрибуции и исправления ошибок в длинных поисковых агентах.

Иллюстрация аудита длинной траектории поискового агента
Иллюстрация аудита длинной траектории поискового агента
Green minimal art set of 2 digital illustrations.jpg | by Anastasia Turkova | wikimedia_commons | CC BY-SA 4.0

Что случилось
На arXiv опубликован препринт SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents. Авторы представили бенчмарк SearchAuditBench и фреймворк SearchAuditor для локализации, атрибуции и исправления ошибок в длинных поисковых агентах. Набор включает 1 243 неудачные траектории, в среднем 73 сообщения и 65 тысяч токенов на запуск, собранные на восьми открытых моделях и пяти бенчмарках глубокого поиска. Каждая траектория размечена экспертами: критический шаг ошибки, корневая причина и эталонное исправление с рубриками оценки.

Почему это важно
Глубокие поисковые агенты выполняют длинные цепочки действий, где небольшая ошибка накапливается и превращается в уверенный, но неверный ответ. Ручной разбор таких траекторий практически невозможен. Работа предлагает автоматизировать поиск источника сбоя и восстановление запуска, снижая нагрузку на человека. Именно поэтому сообщество обсуждает применимость аудита к реальным агентным пайплайнам.

Что подтверждено
Авторы сравнили SearchAuditor с сильными бейзлайнами на фронтьерных моделях. Наилучший бейзлайн на GPT-5.5 достигает 26,6% сквозного прохождения, тогда как SearchAuditor даёт 32,3%. Исправления помогают агентам успешнее продолжать прерванные запуски. Препринт размещён на arXiv, но внешнее рецензирование пока не пройдено, поэтому цифры стоит считать предварительными.

На что смотреть дальше
Стоит проверить воспроизводимость на других моделях, состав поисковых бенчмарков и практическую применимость эталонных исправлений.

Punkt Detail
Источник arXiv cs.AI, препринт 2608.05212
Дата публикации 7 августа 2026
Объём данных 1 243 траектории, 73 сообщения, 65K токенов
Модели и бенчмарки 8 открытых моделей, 5 датасетов
Ключевой результат 32,3% против 26,6% у бейзлайна

Источники: оригинальный препринт — https://arxiv.org/abs/2608.05212 ; проверка данных — https://arxiv.org/ .