Запись архива

Как сравнивать LLM: бенчмарки, evals и цена ошибки

Рейтинги моделей в лентах расходятся, потому что лидерборды отвечают на другой вопрос. Разбираем, какие evals нужны для реальных задач и как собрать тестовый набор за два дня.

Сравнение LLM: бенчмарки, эвалы и цена ошибки
Сравнение LLM: бенчмарки, эвалы и цена ошибки
Hormozgantoday.jpg | by Hormozgantv | wikimedia_commons | CC BY-SA 4.0

Сравнение LLM превратилось в отдельную индустрию: каждый месяц появляются новые рейтинги, и результаты одних и тех же моделей в разных лентах расходятся. Причина не в заговоре, а в том, что лидерборды отвечают на вопрос «какая модель лучше в среднем по большой выборке», тогда как рабочий вопрос звучит иначе: «какая модель нанесёт меньше ущерба на моих данных и при моём бюджете». Разбираем, как читать бенчмарки, зачем собирать собственные эвалы и как считать цену ошибки.

Почему лидерборды не отвечают на ваш вопрос

Общедоступные рейтинги вроде LMArena измеряют усреднённую эффективность моделей на фиксированных наборах заданий. У этого подхода три системные проблемы.

Первая — контаминация. Если тестовые задания попадали в обучающие данные, модель запоминает ответы, а не учится решать задачи. Поэтому классика вроде MMLU уже малоинформативна для сильных моделей: результаты приближаются к потолку, а на свежих задачах разрыв между моделями снова появляется.

Вторая — узость выборки. Лидерборд — это средняя температура по больнице. Ваш продакшен — это один узкий сценарий: извлечение данных из счетов, генерация карточек товаров или агентная работа с API. Средний балл по пятидесяти дисциплинам не скажет, как модель справится с вашими форматами и вашими пользователями.

Третья — задержка публикации. Рейтинги обновляются не каждый день, а модели — каждые несколько недель. Решение, принятое по лидерборду, устаревает быстрее, чем вы выкатите интеграцию.

Что измеряют популярные бенчмарки

Чтобы не переплачивать за «общий интеллект», который вам не нужен, полезно разделять бенчмарки по типу навыка. Ниже — краткая карта самых цитируемых наборов.

Бенчмарк Что измеряет Главное ограничение
MMLU, MMLU-Pro Широта знаний, множественный выбор Сильная контаминация, потолок для сильных моделей
HumanEval, LiveCodeBench Генерация кода по описанию HumanEval засвечен, LiveCodeBench обновляет задачи
GSM8K, MATH Математические рассуждения Формат задач далёк от реальных бизнес-кейсов
GPQA Сложные научные вопросы Узкая тематика, экспертный уровень сложности
MT-Bench, LMArena Следование инструкциям, предпочтения людей Оценка вкуса, а не точности фактов

Вывод из этой карты: бенчмарки полезны как фильтр первого уровня, а не как окончательный вердикт. Если модель проваливает базовую арифметику, её не стоит брать в проект с расчётами. Но если модель входит в топ-3, выбор между лидерами определяют ваши собственные эвалы.

За два дня: как собрать собственный eval-набор

Собственный эвал не требует сотен размеченных примеров. Для старта достаточно 50–80 реальных запросов из логов. Сбор занимает день, разметка — второй.

День первый. Выгрузите запросы из прод-логов за 2–4 недели. Отберите: 70% типовых кейсов, 20% сложных (длинные запросы, устаревшие форматы, негативные формулировки) и 10% пограничных (пустой ввод, просьбы выполнить невозможное). Для каждого примера запишите один эталонный ответ. Если задача открытая — генерация текста, — вместо эталона пропишите чек-лист: факты, стиль, ограничения.

День второй. Прогоните 2–4 модели на одинаковых промптах с температурой 0 и фиксированной версией. Точные задачи оцените автоматически или вручную, открытые — с помощью LLM-as-judge. Сначала проверьте самого судью на 20 примерах, сравнив его решения с человеческими: если совпадение меньше 85%, судья вам не подходит.

Такой набор решает три задачи: защита от деградации при обновлении модели, обоснование выбора перед командой и задокументированные ожидания по качеству.

Цена ошибки: метрика, которой нет в лидербордах

Лидерборды считают точность, но не считают ущерб. А именно ущерб определяет, какая модель вам подходит. Стоимость ошибки — это произведение вероятности ошибки на стоимость инцидента.

Если агент сам отправляет ответ клиенту, неверный вывод — это потеря доверия и время поддержки. Если модель предлагает товары в рекомендациях, ошибка дешёвая: пользователь просто проигнорирует карточку. В первом случае вы выберете более консервативную модель и добавите порог уверенности. Во втором — можно взять модель побыстрее и подешевле.

Практический приём: составьте матрицу из трёх строк — «ошибка незаметна», «ошибка заметна, но исправима», «ошибка критична». Для каждой категории запишите типы кейсов и допустимую частоту. Если критичных кейсов больше 1%, модель не проходит, даже если её средний балл выше.

Чек-лист сравнения моделей для продакшена

Когда эвалы прогнаны, не спешите утверждать победителя. Сверьтесь со списком.

  • Зафиксируйте версии моделей и дату прогона: модели обновляются, и через месяц результаты будут другими.
  • Используйте одинаков