Запись архива

Большой контекст побеждает гиперкоррекцию: новый SOTA для GEC без дообучения

Исследователи представили метод, позволяющий LLM исправлять грамматические ошибки с точностью, почти не уступающей тонко настроенным моделям, используя только промпты и пакетную обработку.

Сравнение результатов грамматической коррекции с помощью промптов и тонкой настройки
Сравнение результатов грамматической коррекции с помощью промптов и тонкой настройки
Student Studying in ACES Library (11056363313).jpg | by University of Illinois Library | wikimedia_commons | CC BY 2.0

Что произошло

На arXiv опубликована работа, предлагающая новый подход к грамматической коррекции текста (Grammatical Error Correction, GEC) с минимальным числом правок. Авторы утверждают, что их метод, не требующий тонкой настройки (fine-tuning), достигает F0.5 = 78.32 на тестовом наборе BEA-2019, что всего на 0.38 пункта ниже лучшего single-model результата, полученного с помощью дообучения (Staruch et al., 2025). Основное новшество — комбинация трёх техник: таксономические инструкции, пакетная обработка (batching) и LLM-assisted оптимизация промптов.

Проблема гиперкоррекции

Ключевой вызов для zero-shot и few-shot LLM в задаче минимально-редакционной GEC — систематическая гиперкоррекция. Модели стремятся переписать правильно построенные фрагменты текста, что резко снижает метрику F0.5. Авторы связывают это с «размыванием внимания» (attention dilution) — ограниченной ёмкостью self-attention, которая заставляет модель «выдумывать» правки при обработке одиночных предложений.

Три шага к решению

Таксономические инструкции. Вместо абстрактного «исправь ошибки» промпт содержит иерархический список типов грамматических ошибок. Это задаёт модели чёткие, метрико-согласованные рамки для редактирования. Эффект, однако, сильно зависит от размера модели: сильные LLM выигрывают, слабые — могут терять в качестве.

Пакетная обработка (batching). Несколько неисправленных предложений подаются в одно контекстное окно. Авторы гипотезируют, что это действует как регуляризатор: ограниченная ёмкость self-attention «разбавляется», и модель реже предпринимает ненужные правки. Метод работает для разных семейств LLM.

LLM-assisted Prompt Optimization. Промпты итеративно улучшаются с помощью Gemini 3.1-Pro, который выступает в роли «оптимизатора инструкций». Конечный промпт, обученный на валидационном подмножестве, и дал рекордный результат.

Практические ограничения

Метод остаётся зависимым от базовой модели: таксономические инструкции помогают не всем архитектурам. Пакетная обработка требует аккуратного подбора размера батча — слишком большой контекст может ухудшить качество. Кроме того, подход оптимизирован под метрику F0.5, которая штрафует за ложные срабатывания, но может быть неоптимальна для сценариев, где важна полнота. Код, промпты и результаты открыты.

Почему это важно

Работа демонстрирует, что разрыв между дообучением и промптингом в GEC можно сократить до долей процента без затрат на инфраструктуру. Для практических приложений (чат-боты, редакторы текста, системы проверки кода) это означает возможность получать качество, близкое к fine-tuned моделям, просто меняя инструкции и формат ввода. Для инженеров, работающих с агентами и пайплайнами, это готовый рецепт снижения гиперкоррекции.

Источники

  • arXiv:2609.10810 «Larger Context Window, Fewer Overcorrections: Optimizing Prompts and Batching for Minimal-Edit Grammatical Error Correction» — https://arxiv.org/abs/2609.10810
  • DeepMind Blog (верификационный лид) — https://deepmind.google/discover/blog/