Запись архива

SurveyReview: новый бенчмарк для оценки «обзорных» LLM-судьев

arXiv-препринт предлагает выровненный по рецензентам датасет для оценки LLM-судьев, которые проверяют научные обзоры. Авторы обучили SurveyAlign на Qwen3-32B и снизили MSE с 2.28 до 1.38.

Иллюстрация: LLM-оценка научных обзоров
Иллюстрация: LLM-оценка научных обзоров
Arlington State College Library, students studying (10010394).jpg | by University of Texas at Arlington Photograph Collection | wikimedia_commons | CC BY 4.0

Что произошло
На arXiv появился препринт SurveyReview (arXiv:2608.07641). Авторы собрали 675 обзорных статей и 1 630 рецензий, преобразовали свободные комментарии рецензентов в четыре измерения — читаемость, критичность, полноту и структуру — и предложили стандартный протокол оценки LLM-«судьев» на соответствие человеческим оценкам.

Почему обсуждают
Генерация научных обзоров с помощью LLM стала массовой, и на первый план вышел вопрос контроля качества. Обычно для этого используют LLM-as-a-judge без явной настройки под рецензентов. SurveyReview — попытка построить измеримый стандарт: насколько автоматическая оценка расходится с реальными рецензиями.

Что подтверждено
В работе приведены цифры на тестовом разделе: дообученный SurveyAlign (Qwen3-32B + LoRA) сокращает средний MSE с 2.28 до 1.38 и MAE с 1.15 до 0.69 относительно GPT-5.2 на промптах. Датасет, код и протокол заявлены как открытые.

На что смотреть дальше
Пока неясно, насколько выборка репрезентативна для разных дисциплин и насколько устойчивы четыре измерения. Стоит проверить, как SurveyAlign ведёт себя на свежих статьях за пределами обучающего распределения. Разработчикам полезно взять протокол из репозитория и прогнать собственные модели.

Таблица: оценка бенчмарка

Punkt Detail
Кол-во обзоров 675
Кол-во рецензий 1 630
Измерения оценки Readability, Criticalness, Comprehensiveness, Structure
Базовая модель Qwen3-32B + LoRA
Сравнение с GPT-5.2 MSE 2.28 → 1.38, MAE 1.15 → 0.69

Источники: оригинал — https://arxiv.org/abs/2608.07641; для дальнейшей проверки — https://github.blog/