
Что случилось
На arXiv опубликован препринт SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents. Авторы представили бенчмарк SearchAuditBench и фреймворк SearchAuditor для локализации, атрибуции и исправления ошибок в длинных поисковых агентах. Набор включает 1 243 неудачные траектории, в среднем 73 сообщения и 65 тысяч токенов на запуск, собранные на восьми открытых моделях и пяти бенчмарках глубокого поиска. Каждая траектория размечена экспертами: критический шаг ошибки, корневая причина и эталонное исправление с рубриками оценки.
Почему это важно
Глубокие поисковые агенты выполняют длинные цепочки действий, где небольшая ошибка накапливается и превращается в уверенный, но неверный ответ. Ручной разбор таких траекторий практически невозможен. Работа предлагает автоматизировать поиск источника сбоя и восстановление запуска, снижая нагрузку на человека. Именно поэтому сообщество обсуждает применимость аудита к реальным агентным пайплайнам.
Что подтверждено
Авторы сравнили SearchAuditor с сильными бейзлайнами на фронтьерных моделях. Наилучший бейзлайн на GPT-5.5 достигает 26,6% сквозного прохождения, тогда как SearchAuditor даёт 32,3%. Исправления помогают агентам успешнее продолжать прерванные запуски. Препринт размещён на arXiv, но внешнее рецензирование пока не пройдено, поэтому цифры стоит считать предварительными.
На что смотреть дальше
Стоит проверить воспроизводимость на других моделях, состав поисковых бенчмарков и практическую применимость эталонных исправлений.
| Punkt | Detail |
|---|---|
| Источник | arXiv cs.AI, препринт 2608.05212 |
| Дата публикации | 7 августа 2026 |
| Объём данных | 1 243 траектории, 73 сообщения, 65K токенов |
| Модели и бенчмарки | 8 открытых моделей, 5 датасетов |
| Ключевой результат | 32,3% против 26,6% у бейзлайна |
Источники: оригинальный препринт — https://arxiv.org/abs/2608.05212 ; проверка данных — https://arxiv.org/ .