
Что произошло?
На arXiv вышла препринт-статья, предлагающая метод Weak-to-Strong On-Policy Distillation (W2S-OPD). Вместо традиционного подхода, где учитель обязательно сильнее ученика, авторы строят прокси-учителя из контрастной пары слабых моделей (положительная и отрицательная). Разность их логитов изолирует направление способностей, которое добавляется к базовой модели студента. Студент затем минимизирует reverse KL на своих собственных роллаутах.
Почему это обсуждается?
Метод решает практическую проблему: на frontier нет более сильного учителя, а обучение нескольких экспертов масштаба студента дорого. W2S-OPD позволяет улучшать сильную модель, используя дешёвые слабые модели. В качестве контрастных пар авторы используют: (1) пост-RL эксперта против его пред-RL инициализации, (2) большую базовую модель против меньшей, (3) маленькую модель с правильными против неправильных подсказок.
Что подтверждено?
На четырёх бенчмарках по математике и трёх по коду W2S-OPD превзошла стандартную OPD. В некоторых случаях студент превысил domain teacher, даже когда все источники супервизии были слабее. Анализ показывает, что разные контрасты дают разные сигналы: пост-RL и hint-контрасты подчёркивают структуру рассуждений, а контраст по масштабу — процедуру решения.
Что остаётся неясным?
Пока опубликован только препринт; код обещан в репозитории, но ещё не выложен. Неясна обобщаемость метода на другие домены (например, рассуждения, генерация текста) и устойчивость при выборе контрастных пар. Также не проверено, работает ли подход при большем числе слабых учителей.
| Punkt | Detail |
|---|---|
| Суть метода | Дистилляция сильного студента от контрастной пары слабых моделей (положительная + отрицательная) через прокси-учителя в пространстве логитов |
| Основные контрасты | (1) post-RL vs pre-RL, (2) большая vs малая базовая модель, (3) правильные vs неправильные подсказки |
| Результаты | Превышение OPD на 4 math и 3 code бенчмарках; студент может обогнать domain teacher |
| Доступность | Код: https://github.com/Yu-Fangxu/W2S-OPD (пока не опубликован) |
Что проверить дальше?
Авторы обещают выложить код в открытый доступ. Стоит следить за репозиторием и проверить воспроизводимость на собственных сценариях. Также интересно появление обсуждений в сообществе — возможно, метод будет применён к другим архитектурам и задачам.
Источник: arXiv:2607.26246 (https://arxiv.org/abs/2607.26246). Верификация через GitHub: https://github.blog/
