Запись архива

Chatbot Arena: как считают Elo и при чём тут длина

Разбираем, как Chatbot Arena превращает анонимные парные сравнения в «Arena Elo», почему на деле это Bradley–Terry, и зачем LMSYS отдельно контролирует длину ответа.

Схема расчёта рейтинга Chatbot Arena: анонимные парные бои, Bradley–Terry, добавление признака длины ответа и style control

Chatbot Arena — это живой бенчмарк от LMSYS, где пользователи сравнивают ответы двух анонимных моделей бок о бок. В 2024 году LMSYS подробно описала статистику Arena в отдельной работе, а затем выпустила разбор, показывающий, что на итоговый рейтинг влияет не только содержание ответа, но и его подача — в частности длина и markdown-оформление.

Из-за этого выражение «Arena Elo» легко понять слишком буквально. Исторически Arena действительно стартовала с Elo-подхода, но официальный расчёт лидерборда затем переехал на модель Bradley–Terry; а позже поверх неё LMSYS добавила style control. Ниже — как устроен этот конвейер и что именно означает рейтинг.

Коротко

  • Chatbot Arena собирает не абсолютные баллы, а парные предпочтения: пользователь выбирает лучший из двух анонимных ответов.
  • Название «Arena Elo» осталось исторически, но в официальном лидерборде LMSYS перешла от онлайнового Elo к централизованной оценке Bradley–Terry по всей истории боёв.
  • Такая оценка хорошо подходит для неполного графа сравнений: не нужно, чтобы каждая модель сыграла с каждой одинаковое число раз.
  • Длина ответа важна потому, что пользовательское предпочтение может зависеть не только от фактического качества, но и от стиля подачи. В версии style control LMSYS добавляет длину и элементы markdown как отдельные признаки.
  • Style-controlled рейтинг не отменяет обычный рейтинг: он отвечает на другой вопрос — что останется от предпочтений, если частично вынести эффект стиля за скобки.

Контекст: зачем Chatbot Arena вообще нужен такой рейтинг

Для открытых чатовых задач плохо работают классические тесты с одним правильным ответом. Пользователь может спросить о коде, правке текста, стратегии продукта, математике или ролевой сцене. В таких условиях удобнее не выставлять «оценку по чек-листу», а сравнивать два ответа и спрашивать: какой лучше.

Именно так и устроена Arena. Пользователь пишет один и тот же запрос двум моделям, видит ответы без названий моделей, а затем голосует. В раннем блоге LMSYS отдельно отмечала, что в анализ попадают только голоса, поданные пока имена моделей скрыты; в статье 2024 года тот же принцип описан как основа анонимного crowdsourcing-оценивания.

Дальше возникает статистическая проблема. Это не круговой турнир, где каждая модель обязана сравниваться с каждой одинаковое число раз. Более того, LMSYS сама пишет, что сравнения показываются неравномерно: внимание концентрируют на моделях с близкой силой, где неопределённость выше. Значит, просто считать сырые win rate недостаточно: нужен метод, который умеет восстанавливать общий порядок по неполному и смещённо собранному набору парных побед.

Метод: от парных боёв к одной шкале

1. Один бой превращается в одно наблюдение

В формализации LMSYS каждый бой кодируется как пара «кто сравнивался» и «кто победил». Если упрощать, у нас есть бинарный исход и два участника. Для каждого сравнения строится вектор признаков модели: слева одна модель получает +1, справа другая получает -1, а целевая переменная фиксирует, победил ли левый ответ.

Pr(A побеждает B) = sigmoid(β_A - β_B)

Здесь β_A и β_B — скрытые «силы» моделей. Чем больше разность, тем выше вероятность победы A над B. Это и есть интуиция Bradley–Terry: не абсолютный балл за ответ, а вероятность выигрыша в парном сравнении.

2. Почему «Arena Elo» сегодня не совсем Elo

На запуске Arena в 2023 году LMSYS действительно использовала онлайновый Elo, потому что такой подход естественен для живого потока сравнений. После каждого боя рейтинг можно обновить сразу, а новые модели быстро получают приблизительное место в таблице.

Но в декабре 2023 года LMSYS объяснила, почему для Arena это неидеально. В шахматном Elo важен порядок партий и параметр K, потому что сила игрока может меняться со временем. Для лидерборда LLM ситуация другая: у организаторов есть вся история боёв сразу, а большинство моделей рассматриваются как относительно статичные. Поэтому LMSYS перевела официальный расчёт на Bradley–Terry как на централизованную оценку максимального правдоподобия по всей истории сравнений. В более позднем тексте о style control авторы уже прямо пишут, что «Arena Score» — это коэффициенты Bradley–Terry, которые раньше они называли Elo score.

Практический вывод простой: термин «Arena Elo» в сообществе сохранился, но математически полезнее думать об этом как о BT-оценке на базе логистической регрессии по парным голосам.

3. Где в этой схеме появляется длина

Проблема длины возникает потому, что пользователь выбирает не «истинно лучший ответ» в вакууме, а один из двух конкретно поданных ответов. Более длинный, подробнее оформленный или лучше размеченный ответ может получать преимущество даже тогда, когда основная разница между моделями не в фактической компетентности, а в стиле.

В августе 2024 года LMSYS предложила style control: к обычной Bradley–Terry регрессии добавляются отдельные стилевые признаки. В их первой версии это были нормализованная разница в длине ответа, число markdown-заголовков, жирных элементов и списков.

Pr(A побеждает B) = sigmoid((β_A - β_B) + γ·Δstyle)

Теперь коэффициенты β отвечают за «силу модели после контроля стиля», а коэффициенты γ — за вклад стилевых факторов. В собственном абляционном анализе LMSYS длина выглядела самым заметным стилевым фактором; это важный результат, но здесь стоит подчеркнуть, что он опубликован самой LMSYS и не является независимым консенсусом всей литературы.

Отдельно важно, что такая процедура не объявляет длинные ответы «плохими». Она лишь меняет вопрос. Обычный рейтинг спрашивает: какой ответ люди предпочли как есть. Style-controlled рейтинг спрашивает: что останется от предпочтения, если частично вынести эффект длины и форматирования из модели.

Результаты: что именно меняется после перехода от Elo к BT и затем к style control

Режим Что агрегируется Главное достоинство Главное ограничение
Онлайновый Elo Последовательность боёв по одному Быстро обновляется в живом сервисе Чувствителен к порядку боёв и настройке K
Bradley–Terry Вся история парных побед сразу Лучше подходит для централизованного лидерборда со статичными моделями Смешивает содержание ответа и стиль подачи
Style-controlled Bradley–Terry Та же история боёв плюс признаки стиля Позволяет отдельно оценивать вклад длины и форматирования Остаётся наблюдательным анализом, а не причинным доказательством

Ещё один важный результат из смежных работ: длина сама по себе не объясняет всё. В Arena-Hard команда LMSYS отдельно пишет, что LLM-судьи известны своей чувствительностью к verbosity, но визуально сильной линейной связи между длиной и итоговым score они не увидели; а абляции показали, что длинный ответ может помогать, но не любой рост длины автоматически улучшает результат. Похожую мысль развивают и работы по length-controlled оценке и по DPO: длина может быть и источником смещения, и носителем реальной полезности ответа.

Интерпретация

Наш комментарий

Самая полезная рамка для практиков такая: Chatbot Arena измеряет не «чистый интеллект модели», а предпочтение пользователей в конкретном протоколе сравнения. В базовом режиме туда честно входят и фактическая корректность, и полезность, и тон, и длина, и оформление.

Из этого следует, что обычный Arena score не обязательно «хуже» style-controlled score. Для продуктовой команды, которая строит ассистента для реальных пользователей, именно суммарное предпочтение может быть самым релевантным сигналом: человеку действительно важны и содержание, и форма. Но если вы пытаетесь понять, не переоценивает ли лидерборд модели, которые просто говорят длиннее и красивее, тогда style control — более чистый аналитический слой.

Именно поэтому скачок или падение модели в Arena нельзя читать как простую метку «стала умнее» или «стала глупее». Иногда это может означать, что модель лучше попадает в пользовательский вкус. А иногда — что она выигрывает за счёт более развёрнутой подачи.

Ограничения и критика

Во-первых, style control у LMSYS прямо описан как наблюдательный, а не причинный анализ. Авторы сами предупреждают о скрытых смешивающих факторах. Классический пример: для сложной reasoning-задачи более длинный ответ может быть следствием не «болтливости», а реально более полного разбора.

Во-вторых, Chatbot Arena отражает распределение запросов своей аудитории, а не универсальное распределение всех задач LLM. Это сильная сторона как live-бенчмарка, но и ограничение: ранжирование всегда зависит от того, кто пришёл голосовать и что именно спрашивал.

В-третьих, лидерборд работает с моделями, часть которых доступна через API и может меняться без предупреждения. LMSYS сама отдельно отмечала, что старается фиксировать версии, когда это возможно, но для hosted-моделей стабильность не гарантирована.

В-четвёртых, признаки style control пока ограничены. В первой версии учитывались длина и несколько markdown-признаков. Но стиль — это ещё и тон, вежливость, категоричность отказов, шаблонность дисклеймеров, структура аргумента и многое другое. Сам факт добавления нескольких признаков не означает, что весь эффект презентации уже исчерпан.

Наконец, близкие места в лидерборде не стоит перечитывать как жёсткий тотальный порядок. И в статье LMSYS, и в последующих блогах много внимания уделено доверительным интервалам, separability и устойчивости ранжирования. Для верхушки таблицы разница между соседними моделями может быть интерпретационно тоньше, чем это выглядит в виде одной колонки с рейтингом.

Заключение

Если коротко, Chatbot Arena считает рейтинг не по «экзамену», а по вероятности победы модели в анонимных парных сравнениях. Историческое имя Elo осталось, но рабочая статистика официального лидерборда ближе к Bradley–Terry.

Длина здесь важна потому, что пользовательское предпочтение чувствительно к форме ответа. Поэтому обычный Arena score и style-controlled score отвечают на разные вопросы — и для практики полезно смотреть на оба, не принимая ни один из них за окончательную меру «истинного качества» модели.

Источники

FAQ

Это всё-таки Elo или Bradley–Terry?

Исторически Arena стартовала с Elo, поэтому название прижилось. Но официальный лидерборд LMSYS затем перевела на Bradley–Terry; в поздних текстах авторы прямо называют текущий Arena Score коэффициентами Bradley–Terry.

Если после style control модель опускается ниже, значит её переоценивали?

Скорее это значит, что часть её преимущества объяснялась стилем ответа — например длиной или оформлением. Но это не доказательство «нечестности»: стиль может быть и полезным свойством для реального пользователя.

Почему нельзя просто брать win rate?

Потому что в Arena неполный и неравномерный граф сравнений. Одни модели встречаются чаще, другие реже, и не все пары играют одинаково. Bradley–Terry лучше приспособлена к такой структуре данных.

Учитывает ли style control всю подачу ответа?

Нет. Первая версия LMSYS учитывает длину и несколько markdown-признаков. Это полезный шаг, но не полная причинная декомпозиция всех факторов предпочтения.

Читайте также