
Что произошло
На arXiv появился препринт SurveyReview (arXiv:2608.07641). Авторы собрали 675 обзорных статей и 1 630 рецензий, преобразовали свободные комментарии рецензентов в четыре измерения — читаемость, критичность, полноту и структуру — и предложили стандартный протокол оценки LLM-«судьев» на соответствие человеческим оценкам.
Почему обсуждают
Генерация научных обзоров с помощью LLM стала массовой, и на первый план вышел вопрос контроля качества. Обычно для этого используют LLM-as-a-judge без явной настройки под рецензентов. SurveyReview — попытка построить измеримый стандарт: насколько автоматическая оценка расходится с реальными рецензиями.
Что подтверждено
В работе приведены цифры на тестовом разделе: дообученный SurveyAlign (Qwen3-32B + LoRA) сокращает средний MSE с 2.28 до 1.38 и MAE с 1.15 до 0.69 относительно GPT-5.2 на промптах. Датасет, код и протокол заявлены как открытые.
На что смотреть дальше
Пока неясно, насколько выборка репрезентативна для разных дисциплин и насколько устойчивы четыре измерения. Стоит проверить, как SurveyAlign ведёт себя на свежих статьях за пределами обучающего распределения. Разработчикам полезно взять протокол из репозитория и прогнать собственные модели.
Таблица: оценка бенчмарка
| Punkt | Detail |
|---|---|
| Кол-во обзоров | 675 |
| Кол-во рецензий | 1 630 |
| Измерения оценки | Readability, Criticalness, Comprehensiveness, Structure |
| Базовая модель | Qwen3-32B + LoRA |
| Сравнение с GPT-5.2 | MSE 2.28 → 1.38, MAE 1.15 → 0.69 |
Источники: оригинал — https://arxiv.org/abs/2608.07641; для дальнейшей проверки — https://github.blog/
