Запись архива

JudgeArena: единый фреймворк для оценки LLM-судей появился на arXiv

Препринт JudgeArena объединяет AlpacaEval, Arena-Hard, MT-Bench и m-Arena-Hard под единым интерфейсом со сменными судьями и логированием метаданных. Разбираем, что подтверждено, а что пока заявлено авторами.

Абстрактная иллюстрация фреймворка JudgeArena для оценки LLM-судей
Абстрактная иллюстрация фреймворка JudgeArena для оценки LLM-судей
Lyrical Time Wastr : Take a Picture by Filter | by Beer30 | openverse | by

Что произошло

На arXiv в секции cs.CL опубликован препринт JudgeArena — открытого фреймворка, объединяющего четыре бенчмарка LLM-судей: AlpacaEval, Arena-Hard, MT-Bench и m-Arena-Hard. Единый интерфейс позволяет менять модель-судью, а доступ к моделям идёт через vLLM, llama.cpp или OpenRouter: любая модель может выступать и кандидатом, и судьёй. Авторы заявляют о полном логировании метаданных для прозрачности и воспроизводимости.

Почему это обсуждают

Практика LLM-as-a-judge стала доминирующей, но экосистема фрагментирована: у каждого бенчмарка свой код, зашитый закрытый судья и один протокол оценки. Из-за этого трудно понять, как выбор бенчмарка, судьи, промпта или инференс-бэкенда влияет на выводы о качестве моделей. JudgeArena предлагает системное изучение этих факторов и, по словам авторов, tuned-конфигурации открытых судей, которые не уступают закрытым моделям на человеческих предпочтениях в английском и многоязычном режимах.

Что подтверждено и что нет

Подтверждён факт публикации препринта (Announce Type: new). Заявления о возможностях фреймворка и о качестве открытых судей — утверждения авторов, а не независимая проверка. Код, судя по описанию, открытый, но его состояние и документацию нужно оценивать отдельно. Заявлена симуляция Elo-скорогов LMArena на основе человеческих аннотаций и оценок LLM-судьи; точность метода за пределами описанных условий неясна.

Punkt Detail
Бенчмарки AlpacaEval, Arena-Hard, MT-Bench, m-Arena-Hard
Судьи Любая модель через vLLM, llama.cpp или OpenRouter
Заявленный результат Открытые судьи уровня закрытых, симуляция Elo LMArena
Статус Препринт arXiv, версия v1, рецензирование не указано

Что смотреть дальше

Репозиторий проекта, воспроизводимость на своих задачах, сравнение tuned-конфигураций судей на человеческих данных. Также стоит отслеживать появление сторонних проверок симуляции Elo. Номер 2608.02620 соответствует августу 2026 года — рекомендуется сверить статус версии на сайте arXiv.

Источник: https://arxiv.org/abs/2608.02620
Проверка: https://arxiv.org/ — страница препринта и актуальный статус версии v1.