
Команда Snowflake AI Research опубликовала на arXiv препринт, представляющий HybridDeepResearch — по их заявлению, первый бенчмарк для оценки «глубоких исследований» (deep research), требующих одновременной работы агента как с веб-поиском, так и с SQL-запросами.
Проблема: разрыв между структурированными и неструктурированными данными
Существующие бенчмарки оценивают агентов либо на задачах веб-навигации, либо на SQL-запросах — но не на их комбинации. В реальных аналитических задачах (финансовые отчеты, конкурентный анализ, научные обзоры) агент должен собрать данные из открытых источников, сопоставить их со строгими схемами реляционных баз данных и сохранить ограничения при «передаче» информации между средами.
Структура HybridDeepResearch
Бенчмарк включает 380 задач, основанных на базах данных LiveSQLBench-Base-Lite и общедоступных веб-корпусах. Задачи разделены на три паттерна рассуждения:
SQL2S — агент получает SQL-запрос и должен найти подтверждение в вебе.
S2SQL — агент получает информацию из веба и должен сформулировать SQL-запрос.
Parallel — агент должен одновременно обработать оба источника и выполнить пересечение результатов.
Каждая задача прошла автоматическую валидацию и ручную проверку.
Результаты: даже топ-модели на пределе
Оценка проводилась на нескольких проприетарных и открытых моделях с различными агентными оболочками. На сложном подмножестве задач (hard subset) лучшие результаты показали:
GLM-5.2 — 54% Pass@8
Claude-Sonnet-4.6 — 52% Pass@8
GPT-5 — 50% Pass@8
Pass@8 означает, что модель успешно решает задачу хотя бы в одном из восьми запусков. Для сравнения: на простых задачах показатели достигают 80–90%, что подтверждает, что сложность именно в гибридном переходе между средами.
Ключевое наблюдение: направленное рассуждение (SQL2S и S2SQL) оказалось значительно сложнее параллельного пересечения. Агенты теряют ограничения (constraints) при переносе информации из SQL в веб и обратно — это остается открытой проблемой.
Практическое значение
Для разработчиков AI-агентов бенчмарк становится новым ориентиром: недостаточно уметь хорошо искать в интернете или выполнять SQL-запросы по отдельности. Требуется архитектура, способная сохранять контекст и ограничения при переключении между структурированными и неструктурированными источниками.
Код и наборы данных доступны на GitHub и Hugging Face.
Источники