
Новое исследование, опубликованное на arXiv, впервые детально описывает, как современные LLM-агенты принимают решения о веб-поиске, формулируют запросы и используют найденные результаты. Авторы провели анализ четырёх крупных платформ — ChatGPT, Claude, Grok и DeepSeek, сочетая наблюдения за реальными пользователями (in-vivo) с контролируемыми экспериментами через API тех же моделей (in-vitro).
Как устроено исследование
В работе рассматривается полный жизненный цикл поиска: от решения агента о необходимости обращения к интернету до финального ответа пользователю. Учёные оценивали качество решений о запуске поиска, стратегии формулировки запросов, доменные предпочтения поисковых систем и то, насколько ответы действительно опираются на найденные источники.
Ключевые результаты
Частота поиска не равна качеству. Оказалось, что платформы и модели существенно различаются по частоте обращения к веб-поиску. Однако более частое использование поиска не приводит к заметному улучшению качества ответов. Это ставит под сомнение эффективность «поиска ради поиска» — агент может тратить ресурсы на извлечение информации, которая не улучшает итоговый результат.
Стратегии запросов различаются. Разговорные агенты применяют сложные, но разные подходы к формулировке поисковых запросов. Одни модели склонны к переформулированию исходного вопроса, другие — к декомпозиции сложной задачи на несколько простых запросов.
Доменные предпочтения поисковиков. Исследователи зафиксировали, что поисковые системы, встроенные в платформы, возвращают результаты с предпочтением собственных доменов. Это может влиять на объективность ответов, особенно если пользователь ожидает нейтрального поиска по всему интернету.
Проблема атрибуции. Хотя большинство ответов опираются на найденные результаты, часть утверждений ссылается на источники, которые не были явно процитированы. Это создаёт риски для надёжности и возможности проверки информации.
Платформа | Частота поиска | Качество ответов | Проблема атрибуции
ChatGPT | Высокая | Среднее | Присутствует
Claude | Средняя | Высокое | Минимальная
Grok | Высокая | Среднее | Присутствует
DeepSeek | Низкая | Низкое | Значительная
Почему это важно
Для разработчиков AI-агентов и поисковых инструментов результаты означают, что оптимизация должна идти не по пути увеличения числа поисковых запросов, а через улучшение качества решений о поиске и атрибуции. Для пользователей — что доверять ответам LLM стоит с оговоркой: даже если агент что-то нашёл, это не гарантирует ни релевантности, ни корректности цитирования.
Практические ограничения
Исследование не охватывает все существующие платформы и модели. Кроме того, контролируемые эксперименты через API могут не полностью отражать поведение агентов в реальных диалогах с пользователями. Авторы также отмечают, что доменные предпочтения могут меняться со временем по мере обновления алгоритмов поиска.
Источники
— arXiv:2609.19244v1: Characterizing Web Search by Conversational LLM Agents
— Страница Anthropic о безопасности: https://www.anthropic.com/news
