Запись архива

AgentCheck — регрессионное тестирование для ИИ-агентов с дифф-отчётами в CI

Инструмент для регрессионного тестирования ИИ-агентов, использующий LLM-судью для оценки ответов. Поддерживает YAML-тесты, CI-интеграцию и PR-комментарии с дифф-анализом.

Редакционная обложка COMRAD404: AgentCheck — регрессионное тестирование для ИИ-агентов с дифф-отчётами в CI
Редакционная обложка COMRAD404: AgentCheck — регрессионное тестирование для ИИ-агентов с дифф-отчётами в CI
Редакционная тематическая обложка COMRAD404

Что произошло

На Hacker News появилось обсуждение открытого инструмента AgentCheck — библиотеки для регрессионного тестирования ИИ-агентов. Автор опубликовал код на GitHub с фокусом на предрелизные проверки в CI, а не на production-мониторинг.

Почему это обсуждают

Проект решает специфическую проблему: при изменении промпта, замене инструмента или обновлении модели поведение агента может незаметно сломаться. AgentCheck предлагает простой YAML-формат тестов, где каждый кейс содержит входные данные и описание ожидаемого ответа на естественном языке. Оценка результата передаётся LLM-судье — никакого хрупкого сравнения строк.

Что подтверждено

Из документации и кода:

Punkt Detail
Установка pip install, локальный запуск через `agentcheck run`
Формат тестов YAML: input + описание корректного ответа + способ вызова агента (CLI или HTTP)
Оценка LLM-судья выносит вердикт pass/fail с обоснованием
CI-интеграция GitHub Actions, поддержка PR-комментариев с таблицей результатов
Дифф-анализ Сравнение с baseline: unchanged, regressed, improved, new, removed

Инструмент не задумывался как замена платформам observability (Langfuse, Braintrust, Arize) — это узкий, dev-friendly слой для пре-деплойных проверок.

Что остаётся неясным

На момент публикации обсуждение на HN имеет 1 балл и 0 комментариев — проект только появился на радаре сообщества. Неизвестно, как библиотека ведёт себя на сложных мультишаговых сценариях и насколько стабильна LLM-оценка на разных моделях. Также не указаны поддерживаемые LLM-провайдеры для судьи (пример использует Anthropic).

Что смотреть дальше

Репозиторий активно развивается, есть примеры workflow для GitHub Actions. Стоит отслеживать issues и PR, а также тестировать на собственных агентах. Если проект получит фидбек от сообщества, может стать стандартным инструментом в CI-пайплайнах для AI-агентов.

Источники: GitHub (https://github.com/rez-99/agentcheck), обсуждение на Hacker News (https://news.ycombinator.com/item?id=49393322). Верификация: блог GitHub (https://github.blog/).