Запись архива

Масштабное исследование 14 767 бенчмарков: как меняются ожидания от LLM

Учёные изучили почти 15 тысяч бенчмарков для LLM, опубликованных на arXiv с 2022 по 2026 год. Главный вывод: растёт запрос на действия, взаимодействие и профессиональные задачи, а также неоднородность в участии самих моделей при оценке и генерации тестов.

Визуализация трендов в дизайне бенчмарков LLM по результатам анализа 14 767 работ arXiv (2022–2026)
Визуализация трендов в дизайне бенчмарков LLM по результатам анализа 14 767 работ arXiv (2022–2026)
MAC Tools screwdrivers (49972375983).jpg | by Iwao from Tokyo, Japan | wikimedia_commons | CC BY-SA 2.0

На arXiv опубликовано исследование, в котором авторы систематически проанализировали 14 767 научных работ, вводивших или обновлявших оценочные ресурсы для больших языковых моделей (LLM). Выборка охватывает все препринты arXiv, размещённые с января 2022 по август 2026 года. Методология включала многоэтапный скрининг и автоматическое полнотекстовое кодирование, позволившее проследить изменения в целевых системах, доменах, материалах и механизмах оценки.

Ключевые тренды

Исследователи выделяют несколько устойчивых направлений. Во-первых, всё большее внимание уделяется способности LLM не просто генерировать текст, а совершать действия (action) и взаимодействовать с окружением (interaction). Во-вторых, растёт доля бенчмарков, нацеленных на профессиональные области — медицина, юриспруденция, инженерия. При этом старые дизайнерские элементы (например, статичные question-answering) не исчезают, а сосуществуют с новыми.

Неравномерное участие моделей

Отдельного внимания заслуживает то, как сами LLM вовлекаются в процесс оценки. Метод scoring на основе LLM (model-as-judge) растёт как в агентных, так и в неагентных бенчмарках. Однако генерация тестовых материалов самими моделями не демонстрирует устойчивого роста в последних когортах — после первоначального всплеска эта практика стабилизировалась.

Практический смысл для разработчиков

Для сообщества AI-инженеров эти результаты означают, что выбор бенчмарка — это не просто техническая задача, а зеркало эволюционирующих ожиданий. Если раньше достаточно было ответить на вопросы, то теперь тесты всё чаще требуют демонстрации агентного поведения. Кроме того, авторы поднимают важный эпистемологический вопрос: по мере того как ИИ участвует в конструировании тестов, выполнении заданий и оценивании ответов, не воспроизводит ли экосистема бенчмарков собственные слепые зоны моделей? Это сигнал к тому, чтобы критически подходить к результатам и не полагаться на единственный метрический рейтинг.

Источники
Оригинальная статья: What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks (arXiv 2609.19182) — https://arxiv.org/abs/2609.19182
Верификация поступления: https://arxiv.org/