ThinkingBox: почему ИИ-агент говорит «готово», хотя задача не выполнена

ThinkingBox проверяет реальный результат работы ИИ-агента. Разбираем случай закрытой заявки, метрики pass@1 и pass@20 и проверки перед запуском автоматизации.

ThinkingBox сравнивает фактическое состояние обращения с условиями задачи: resolved вместо on hold.

Microsoft и Hugging Face опубликовали разбор ThinkingBox 3 октября. Проверка сравнивает результат работы ИИ-агента с нужным состоянием системы. Корректный вызов инструмента ещё не доказывает, что задача выполнена.

ThinkingBox сравнивает фактическое состояние обращения с условиями задачи: resolved вместо on hold.
Редакционная схема: агент закрыл обращение, хотя проблема с доставкой требует ожидания.

Обращение закрыто, доставка всё ещё задерживается

В примере авторов агент сделал девять вызовов инструментов и закрыл обращение покупателя, хотя проблема доставки осталась. Требовался статус ожидания, on hold. В исследовании на общем наборе из 121 680 испытаний 12 моделей 79 853 попытки провалили проверки. При этом 67,24% неудачных попыток завершились штатно и вызвали изменяющий состояние инструмент без итоговой ошибки.

Такой сбой трудно заметить по разговору. Пользователь получает уверенный ответ, разработчик видит успешный запрос к API, а сотрудник поддержки позже обнаруживает закрытую заявку. Проверять нужно само изменение: какую запись обновили, какое значение записали и осталось ли что-то сделать.

Три показателя, которые нельзя смешивать

Авторы повторяют каждую задачу двадцать раз из одинакового исходного состояния:

  • pass@1: доля успешных попыток.
  • pass@20: доля задач, решённых хотя бы раз за двадцать попыток.
  • Observed 20/20: число задач, прошедших все двадцать попыток.

Последний показатель описывает наблюдение в эксперименте. Он не гарантирует успех следующего запуска. Высокий pass@20 тоже не равнозначен надёжности: одной удачи достаточно, чтобы задача попала в число решённых.

В таблице авторов на 507 задачах лучший общий pass@1 у Claude Opus 5.5: 67,16%. Среди моделей с открытыми весами лидирует Kimi-K3: 57,37%. Эти результаты относятся к условиям данного бенчмарка.

Что проверять в собственном агенте

Начать стоит с условия приёмки. Для агента, публикующего материалы, ответ «статья опубликована» ничего не подтверждает сам по себе. Нужно получить реальный объект CMS, проверить статус публикации, нужную рубрику и доступность страницы. Это пример применения принципа ThinkingBox, а не дополнительный результат исследования.

Отдельно полезно проверить лишние изменения. Правильно обновлённая запись не оправдывает случайное закрытие соседней заявки или изменение чужого заказа. Проверка должна учитывать как выполненные требования, так и запрещённые действия.

Повторять испытания следует с восстановлением исходного состояния. Иначе второй запуск может получить уже выполненную задачу: агенту останется только прочитать результат первого, и оценка окажется завышенной.

При обнаружении расхождения нельзя автоматически повторять любую операцию. Например, повтор создания заказа способен породить дубликат. Для действий с побочными эффектами заранее нужны правила сверки результата, допустимого повтора и передачи спорной ситуации человеку.

Мы разбираем публикацию авторов, а не результаты собственного запуска ThinkingBox. Для выбора модели под конкретный бизнес-процесс нужен набор задач из этого процесса и заранее определённые проверки. Чужой бенчмарк помогает выбрать, что измерять; решение о запуске агента требует проверки на вашей системе.