Запись архива

Weak-to-Strong On-Policy Distillation: слабые модели как учителя для сильных LLM

Новая работа с arXiv предлагает метод дистилляции, при котором несколько слабых моделей (меньшего размера) могут улучшить сильную модель-студента без необходимости в более крупном учителе. Подход использует контрастную пару в пространстве логитов.

Схема метода Weak-to-Strong On-Policy Distillation
Схема метода Weak-to-Strong On-Policy Distillation
Three female students studying in the library at Mankato State Normal School, Mankato, Minnesota – DPLA – 0704e723ee935142bbde01e37e2cd7fb.jpg | by Snow, John R | wikimedia_commons | Public domain

Что произошло?

На arXiv вышла препринт-статья, предлагающая метод Weak-to-Strong On-Policy Distillation (W2S-OPD). Вместо традиционного подхода, где учитель обязательно сильнее ученика, авторы строят прокси-учителя из контрастной пары слабых моделей (положительная и отрицательная). Разность их логитов изолирует направление способностей, которое добавляется к базовой модели студента. Студент затем минимизирует reverse KL на своих собственных роллаутах.

Почему это обсуждается?

Метод решает практическую проблему: на frontier нет более сильного учителя, а обучение нескольких экспертов масштаба студента дорого. W2S-OPD позволяет улучшать сильную модель, используя дешёвые слабые модели. В качестве контрастных пар авторы используют: (1) пост-RL эксперта против его пред-RL инициализации, (2) большую базовую модель против меньшей, (3) маленькую модель с правильными против неправильных подсказок.

Что подтверждено?

На четырёх бенчмарках по математике и трёх по коду W2S-OPD превзошла стандартную OPD. В некоторых случаях студент превысил domain teacher, даже когда все источники супервизии были слабее. Анализ показывает, что разные контрасты дают разные сигналы: пост-RL и hint-контрасты подчёркивают структуру рассуждений, а контраст по масштабу — процедуру решения.

Что остаётся неясным?

Пока опубликован только препринт; код обещан в репозитории, но ещё не выложен. Неясна обобщаемость метода на другие домены (например, рассуждения, генерация текста) и устойчивость при выборе контрастных пар. Также не проверено, работает ли подход при большем числе слабых учителей.

Punkt Detail
Суть метода Дистилляция сильного студента от контрастной пары слабых моделей (положительная + отрицательная) через прокси-учителя в пространстве логитов
Основные контрасты (1) post-RL vs pre-RL, (2) большая vs малая базовая модель, (3) правильные vs неправильные подсказки
Результаты Превышение OPD на 4 math и 3 code бенчмарках; студент может обогнать domain teacher
Доступность Код: https://github.com/Yu-Fangxu/W2S-OPD (пока не опубликован)

Что проверить дальше?

Авторы обещают выложить код в открытый доступ. Стоит следить за репозиторием и проверить воспроизводимость на собственных сценариях. Также интересно появление обсуждений в сообществе — возможно, метод будет применён к другим архитектурам и задачам.

Источник: arXiv:2607.26246 (https://arxiv.org/abs/2607.26246). Верификация через GitHub: https://github.blog/