Модель на 0,8 млрд параметров обошла GPT-5 в разметке грамматики

Авторы исследования внедрили небольшую дообученную модель для анализа уроков английского. По их оценке, она точнее отвечала на тестах, чем модели GPT-5.4 и GPT-5.6 Sol, а обходилась примерно в 16 раз дешевле.

Схема анализа грамматических ошибок в расшифровке урока английского языка
Схема анализа грамматических ошибок в расшифровке урока английского языка
Sias Library — Students Studying 2017.jpg | by Gary Todd | wikimedia_commons | CC0

Авторы новой работы на arXiv сообщают, что дообученная модель Qwen3.5 на 0,8 млрд параметров точнее GPT-5.4 и GPT-5.6 Sol размечала грамматические ошибки в расшифровках уроков английского. Модель уже встроили в систему отслеживания освоения грамматики на платформе для изучающих английский. По оценке авторов, её использование обходится примерно в 16 раз дешевле.

Как устроена система

Модель обрабатывает диалоги ученика с преподавателем и выделяет грамматические понятия, связанные с ними фрагменты текста и корректность разметки. Для обучения использовали созданные преподавателями примеры, которые авторы отфильтровали и сбалансировали. По их описанию, правила разметки «встроили» в параметры модели с помощью дообучения: поэтому ей достаточно короткой инструкции вместо большого промпта.

Речь не просто о поиске ошибок в отдельной фразе. Система должна собирать наблюдения по урокам в представление о том, какие грамматические темы ученик уже освоил, а какие требуют внимания.

Что показали тесты

В статье сравниваются модели на двух наборах данных, размеченных людьми. Авторы проверяли качество при нескольких уровнях строгости: совпадает ли грамматическое понятие, верно ли указан фрагмент доказательства и правильно ли оценена разметка. По их результатам, и модель на 0,8 млрд параметров, и вариант на 4 млрд параметров превзошли GPT-5.4 и GPT-5.6 Sol по точности и полноте на этих проверках.

Это вывод авторов исследования, а не доказательство общего превосходства небольших моделей над передовыми системами. Результат относится к конкретной задаче, наборам данных и критериям оценки. В доступном описании также нет подробностей, позволяющих независимо оценить состав тестов или воспроизвести сравнение.

Эффект в продукте и его границы

Авторы сообщают, что встроенная функция прошла онлайн-эксперимент: вовлечённость учеников выросла на 15,8%, число запланированных часов занятий — на 2,1%, а объём новых уроков в денежном выражении — на 13,2%. Это результаты конкретной платформы и её эксперимента; переносить их на другие сервисы без проверки нельзя.

Практический вывод осторожнее рекламного: узкую задачу с понятными примерами и критериями оценки может быть выгодно решать небольшой специализированной моделью. Здесь экономия объясняется не только размером модели, но и адаптацией к конкретной разметке и компактной инструкцией. Подойдёт ли такой подход для другого языка, учебной программы или менее структурированных разговоров, из описания работы не следует.

Источники