Запись архива

Новый бенчмарк HybridDeepResearch: LLM-агенты проваливают гибридные SQL-запросы и веб-поиск

Команда Snowflake AI Research представила HybridDeepResearch — первый бенчмарк, проверяющий способность LLM-агентов одновременно работать с веб-поиском и SQL-запросами. Даже флагманские модели (GLM-5.2, Claude-Sonnet-4.6, GPT-5) набирают лишь 50–54% Pass@8 на сложных задачах.

Схема работы гибридного агента: соединение реляционной базы данных и веб-поиска через LLM
Схема работы гибридного агента: соединение реляционной базы данных и веб-поиска через LLM
Public sector strike march leaves Chapelfield Gardens to march through Norwich City centre | by Roger Blackwell | openverse | by

Команда Snowflake AI Research опубликовала на arXiv препринт, представляющий HybridDeepResearch — по их заявлению, первый бенчмарк для оценки «глубоких исследований» (deep research), требующих одновременной работы агента как с веб-поиском, так и с SQL-запросами.

Проблема: разрыв между структурированными и неструктурированными данными

Существующие бенчмарки оценивают агентов либо на задачах веб-навигации, либо на SQL-запросах — но не на их комбинации. В реальных аналитических задачах (финансовые отчеты, конкурентный анализ, научные обзоры) агент должен собрать данные из открытых источников, сопоставить их со строгими схемами реляционных баз данных и сохранить ограничения при «передаче» информации между средами.

Структура HybridDeepResearch

Бенчмарк включает 380 задач, основанных на базах данных LiveSQLBench-Base-Lite и общедоступных веб-корпусах. Задачи разделены на три паттерна рассуждения:

SQL2S — агент получает SQL-запрос и должен найти подтверждение в вебе.

S2SQL — агент получает информацию из веба и должен сформулировать SQL-запрос.

Parallel — агент должен одновременно обработать оба источника и выполнить пересечение результатов.

Каждая задача прошла автоматическую валидацию и ручную проверку.

Результаты: даже топ-модели на пределе

Оценка проводилась на нескольких проприетарных и открытых моделях с различными агентными оболочками. На сложном подмножестве задач (hard subset) лучшие результаты показали:

GLM-5.2 — 54% Pass@8

Claude-Sonnet-4.6 — 52% Pass@8

GPT-5 — 50% Pass@8

Pass@8 означает, что модель успешно решает задачу хотя бы в одном из восьми запусков. Для сравнения: на простых задачах показатели достигают 80–90%, что подтверждает, что сложность именно в гибридном переходе между средами.

Ключевое наблюдение: направленное рассуждение (SQL2S и S2SQL) оказалось значительно сложнее параллельного пересечения. Агенты теряют ограничения (constraints) при переносе информации из SQL в веб и обратно — это остается открытой проблемой.

Практическое значение

Для разработчиков AI-агентов бенчмарк становится новым ориентиром: недостаточно уметь хорошо искать в интернете или выполнять SQL-запросы по отдельности. Требуется архитектура, способная сохранять контекст и ограничения при переключении между структурированными и неструктурированными источниками.

Код и наборы данных доступны на GitHub и Hugging Face.

Источники

Препринт на arXiv: arXiv:2609.09410

Репозиторий GitHub: Snowflake-AI-Research/HybridDeepResearch

Датасет на Hugging Face: Snowflake/HybridDeepResearch

Страница Anthropic (verification lead): anthropic.com/news