Запись архива

LiveBench: что реально измеряет бенчмарк, который «нельзя выучить»

LiveBench обещал стать бенчмарком, который трудно «выучить» через тренировочные данные. Разбираем стартовую версию 2024 года, её метод, результаты и ограничения по paper, datasheet и changelog проекта.

Схема пайплайна LiveBench: свежие источники вопросов, генерация проверяемых задач, запуск моделей и автоматическая проверка по ground truth

LiveBench — это rolling-бенчмарк для LLM, публично открытый 12 июня 2024 года и описанный в arXiv-версии статьи от 27 июня 2024 года. Его ключевая идея проста: если вопросы регулярно обновлять, брать из свежих источников и проверять по объективному ground truth, то бенчмарк будет хуже поддаваться загрязнению тренировочными данными и меньше зависеть от ошибок LLM-судьи.

Это важная попытка решить сразу две хронические проблемы оценки LLM: утечки теста и смещение judge-based leaderboards. Но формула «бенчмарк, который нельзя выучить» слишком сильная: в более поздних официальных материалах авторы сами смягчили язык с contamination-free до contamination-limited, а свежие вопросы стали публиковать с задержкой. Ниже — разбор именно стартовой версии 2024 года и того, как проект эволюционировал дальше.

Коротко

  • LiveBench в запуске 2024 года делал ставку на три вещи: свежие источники вопросов, автоматическую проверку по ground truth и ежемесячные обновления.
  • Стартовый публичный релиз от 12 июня 2024 года содержал 960 вопросов; datasheet указывает окно сборки с 1 апреля по 12 июня 2024 года.
  • В launch-PDF авторы сообщают, что лучший общий результат тогда показал claude-3-5-sonnet-20240620 с 61.2 баллами; в той же версии статьи ни одна модель не превышала 65%.
  • Одно из самых сильных мест работы — абляция против LLM-судьи: для части сложных математических и логических задач GPT-4-Turbo ошибался как judge до 46% случаев по данным авторов.
  • Главная оговорка: LiveBench не делает утечки невозможными. Это видно и по позднему переименованию статьи в contamination-limited, и по задержке публикации самых свежих вопросов, и по внутренним расхождениям между paper, datasheet и changelog.

Контекст

LiveBench появился в момент, когда у сообщества уже накопились два типа претензий к популярным LLM-бенчмаркам. Первая — статические тесты быстро попадают в тренировочные наборы и перестают измерять обобщение. Вторая — лидерборды с LLM-as-a-judge часто меряют не только качество ответа, но и стиль, длину и сходство с самим судьёй.

Проблему загрязнения на коде хорошо показывал LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code, а более общий временной взгляд — Data Contamination Through the Lens of Time. Для judge-based оценки важны как минимум две опорные работы: Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena и Large Language Models are not Fair Evaluators.

На этом фоне LiveBench пытался занять промежуточную позицию. Он не хотел быть ни полностью статическим тестом вроде классических офлайн-наборов, ни полностью judge-based ареной с открытыми ответами. Идея была в том, чтобы строить «живой» набор задач из недавних источников, но сохранять автоматическую проверку.

Важно зафиксировать историческую рамку. Этот разбор относится к стартовой версии проекта образца июня 2024 года. К 12 августа 2026 года официальный сайт LiveBench уже описывает систему как набор из 23 задач в 7 категориях с полным обновлением каждые шесть месяцев и с задержкой публикации самых свежих вопросов. Это не опровергает стартовую статью, но означает, что LiveBench — не один фиксированный бенчмарк, а меняющийся протокол.

Метод

Что авторы хотели сделать

В launch-PDF и в GitHub-материалах замысел сформулирован почти одинаково: ограничить загрязнение теста и убрать зависимость от LLM-судей. Для этого LiveBench использует только те задачи, где можно автоматически проверить ответ по объективному эталону, а сами вопросы строит либо из свежих источников, либо как более трудные варианты старых задач.

Стартовый релиз был публично открыт 12 июня 2024 года. В datasheet указано, что начальная версия собиралась в окне с 1 апреля по 12 июня 2024 года, а большинство вопросов опирались только на вопрос или данные после 1 апреля 2024 года. Это важная деталь: проект с самого начала был привязан ко времени.

Из чего состоял LiveBench 2024

По paper и проектным материалам задачи были распределены по шести категориям: математика, код, рассуждение, language comprehension, instruction following и data analysis. Источники тоже были разнородными:

  • математика — свежие школьные и олимпиадные соревнования, а также более тяжёлый вариант AMPS;
  • код — задачи из LiveCodeBench плюс отдельный task на code completion;
  • рассуждение — усложнённый Web of Lies и Zebra Puzzles;
  • язык — Connections, исправление опечаток в свежих arXiv abstract и восстановление порядка предложений в синопсисах фильмов из IMDb и Wikipedia;
  • instruction following — задачи по недавним статьям The Guardian с верифицируемыми ограничениями;
  • data analysis — задания по табличным данным из Kaggle и Socrata.

Стартовый пакет содержал 960 вопросов. Это число сходится между datasheet и changelog. При этом в официальных артефактах есть расхождения по числу задач: changelog для 12 июня 2024 года говорит о 17 задачах, а launch-PDF в одном месте пишет о 18, хотя перечисление категорий внутри самой статьи тоже фактически складывается в 17. Для практиков это не мелочь, а сигнал: воспроизводимость здесь требует жёстко фиксировать не только название бенчмарка, но и конкретный релиз, статью и changelog.

Как оценивание устроено технически

Главная инженерная идея LiveBench — не судить ответы другой LLM, а сравнивать их с ground truth. Для кода это означает исполняемую проверку и pass@1; для математики — проверку эквивалентности выражений; для части остальных задач — структурированный ответ, который можно автоматически распарсить и сверить.

У такого подхода есть и оборотная сторона. Поздняя ICLR-версия статьи прямо признаёт, что требование отвечать в XML-тегах или в другом легко парсимом формате само по себе добавляет компонент instruction following. То есть LiveBench измеряет не только «чистую» способность решить задачу, но и способность уложить решение в нужный формат.

Результаты

Ниже — числа из таблицы 1 launch-PDF. Это именно снимок стартовой версии 2024 года; авторы позже расширяли набор задач и список моделей, поэтому сравнивать эти значения с текущим сайтом LiveBench напрямую нельзя.

Модель Общий балл Код Data analysis Instruction following Language Math Reasoning
claude-3-5-sonnet-20240620 61.2 63.2 56.7 72.3 56.9 53.7 64.0
gpt-4o-2024-05-13 55.0 46.4 52.4 72.2 53.9 49.9 55.0
gpt-4-turbo-2024-04-09 53.0 47.1 51.3 71.4 45.3 49.0 54.0
gpt-4-1106-preview 52.2 44.4 51.3 69.4 48.4 47.6 52.0
claude-3-opus-20240229 50.8 40.1 54.3 70.9 51.7 46.5 41.0
deepseek-coder-v2 46.8 41.1 38.3 67.2 33.0 52.2 49.0

По launch-PDF авторы тогда делали два вывода. Во-первых, бенчмарк был действительно трудным: в той версии статьи сказано, что ни одна модель не превышала 65% точности, а максимум в таблице 1 составлял 61.2. Во-вторых, порядок моделей заметно зависел от категории: модель, сильная в instruction following, не обязательно столь же сильна в reasoning или math.

Ещё один важный результат — собственная проверка LiveBench против LLM-судей. В таблице 2 авторы измеряли ошибку GPT-4-Turbo как judge на задачах AMC12 2024, AIME 2024, SMC 2023 и Zebra Puzzles. По их данным, ошибка доходила до 46.0% при оценке ответов claude-3-opus-20240229 на Zebra Puzzles и до 42.0% при оценке ответов самого gpt-4-turbo-2024-04-09 на той же задаче. Это сильный аргумент в пользу объективной автоматической проверки там, где она возможна.

При сравнении с другими лидербордами LiveBench не оказался полностью «в другом мире»: авторы сообщают корреляцию 0.91 с ChatBot Arena и 0.88 с Arena-Hard. Но они же показывают, что некоторые модели, особенно GPT-4-семейство, выглядят относительно сильнее на Arena-Hard, где используется judge-based схема. Иными словами, LiveBench не отменяет все остальные бенчмарки, а скорее меняет то, что именно считается сигналом.

Интерпретация

Наш комментарий

Сильная сторона LiveBench не в том, что он «наконец-то честно измерил интеллект». Сильная сторона в более узком и практическом тезисе: авторы превратили бенчмарк из статического файла в постоянно обслуживаемый eval-пайплайн. Для инженеров это, возможно, важнее любого отдельного leaderboard score.

Если смотреть на LiveBench именно как на пайплайн, а не как на раз и навсегда зафиксированный набор вопросов, становится понятнее и поздняя эволюция проекта. Сайт LiveBench позже перешёл к полному обновлению каждые шесть месяцев и задержке публикации свежих вопросов. Это логичный шаг: если вы публично выкладываете и сами вопросы, и модельные ответы, то рано или поздно они становятся частью обучающей среды будущих моделей. Следовательно, формула contamination-free плохо выдерживает время, а contamination-limited звучит точнее.

Отсюда и главный практический смысл LiveBench. Это хороший стресс-тест на свежесть данных, форматное следование инструкции и способность решать проверяемые задачи без judge bias. Но это не замена всем другим типам оценки: он почти ничего не говорит о качестве открытых, субъективных или многоходовых задач без жёсткого ground truth.

Ограничения

1. LiveBench не делает загрязнение невозможным. Уже в datasheet есть оговорка, что не все источники строго новее 1 апреля 2024 года: часть материалов в математическом разделе старше, включая задачи, связанные с IMO 2023. Поздняя arXiv-версия и ICLR-публикация дополнительно смягчают риторику до contamination-limited.

2. Проект — движущаяся цель. В официальных артефактах стартовой эпохи расходятся числа: 17 против 18 задач, 34 против 49 моделей, а ICLR-версия уже описывает другой по составу набор с пространственным reasoning и иным списком моделей. Для корректного сравнения нужно фиксировать релиз, дату статьи и список задач.

3. Объективная проверка сужает класс задач. Авторы сами пишут, что такой подход плохо покрывает запросы вроде «напиши письмо начальнику» или «сделай travel guide», где нет одного проверяемого ответа. Поэтому LiveBench хорошо подходит для верифицируемых задач, но не для всей поверхности применения LLM.

4. Парсинг ответа может влиять на счёт. Требование отвечать в заданном формате полезно для автоматической проверки, но одновременно добавляет компонент instruction following. Ошибка может быть не в решении задачи как таковой, а в упаковке ответа.

5. Даже объективные задачи могут ломаться. Changelog фиксирует, что 24 июня 2024 года из набора убрали house traversal task: после исправления неоднозначности в парсинге некоторые модели стали получать на нём 100%. Это хороший пример того, что «объективная» метрика тоже требует ручной санитарной проверки.

6. Языковое покрытие ограничено. Datasheet явно говорит, что инстансы — это английские вопросы, а в разделе limitations paper отмечает потребность в неанглоязычных задачах. Для русскоязычной практики это важно: перенос выводов на другие языки не автоматический.

Вывод

LiveBench важен не потому, что нашёл идеальный способ измерять LLM, а потому, что честно атаковал две реальные проблемы 2024 года: тестовые утечки и judge bias. Его архитектура — свежие источники, objective ground truth и регулярные обновления — остаётся одной из самых практичных схем для «живой» оценки моделей.

Но название темы стоит читать с поправкой: LiveBench — это не бенчмарк, который нельзя выучить, а бенчмарк, который пытается сделать выучивание менее выгодным и менее вероятным. И по тому, как проект позже сам перешёл к delayed release и более осторожной формулировке contamination-limited, видно, что авторы это тоже понимают.

Источники

FAQ

Чем LiveBench отличается от обычного статического бенчмарка?

Статический набор вопросов со временем почти неизбежно попадает в тренировочные данные новых моделей. LiveBench задуман как обновляемый eval-пайплайн: вопросы берут из свежих источников, релизы меняются, а новые задачи со временем усложняются.

Почему нельзя буквально говорить, что LiveBench «нельзя выучить»?

Потому что это слишком сильное утверждение. В более поздних официальных материалах авторы сами перешли от contamination-free к contamination-limited и начали задерживать публикацию самых свежих вопросов — именно чтобы дополнительно снижать риск утечек.

Что в LiveBench сильнее всего бьёт по judge-based leaderboards?

Собственная абляция авторов: GPT-4-Turbo как judge допускал высокую ошибку на сложных математических и логических задачах. Это не доказывает, что любой LLM-judge бесполезен, но показывает, что для верифицируемых задач ground-truth-проверка предпочтительнее.

Можно ли сравнивать score из статьи 2024 года с текущим сайтом LiveBench?

Напрямую — нет. Состав задач, частота обновлений и даже число категорий со временем менялись, поэтому LiveBench нужно сравнивать только внутри одного релиза или очень аккуратно с учётом changelog.

Читайте также