«Let’s Verify Step by Step» — работа OpenAI, впервые опубликованная 31 мая 2023 года как препринт и исследовательский пост компании. Авторы сравнивают два способа обучать reward model для математических задач: по финальному ответу (outcome supervision) и по каждому шагу решения (process supervision). Важно, что это исторический разбор именно этого источника: не более поздних reasoning-моделей OpenAI, а конкретной попытки научить систему замечать ошибку в цепочке рассуждения до того, как она испортит весь ответ.
Главная идея проста: если модель решает задачу пошагово, то и обратную связь ей полезно давать пошагово. Авторы проверяют, дает ли такая более плотная разметка практический выигрыш, сколько она стоит в данных, и где именно такой подход сильнее обычной проверки только итогового ответа.
Коротко
- OpenAI сравнила outcome supervision и process supervision на сложном математическом бенчмарке MATH, а не на более простых школьных задачах.
- В large-scale эксперименте process reward model (PRM) показала 78,2% на удержанном подмножестве MATH при best-of-1860, против 72,4% у outcome reward model (ORM) и 69,6% у majority voting.
- Авторы выпустили PRM800K: отфильтрованный обучающий набор примерно из 800 000 step-level меток на 75 000 решениях; в приложении также указан полный несфильтрованный массив из 1 085 590 меток на 101 599 решений.
- В контролируемой small-scale абляции process supervision снова выигрывает, а активный отбор примеров дает оценку улучшения эффективности разметки примерно в 2,6 раза.
- Но есть и серьезные оговорки: нестандартный split MATH, не совсем сопоставимые датасеты для ORM и PRM, риск false positives у answer-only оценки и неизвестная переносимость за пределы математики.
Контекст
Работа стоит на пересечении двух линий исследований. Первая — reward modeling: мы обучаем отдельную модель оценивать качество ответа и затем используем ее либо для реранжирования нескольких кандидатных решений, либо как сигнал в RL-пайплайне. Вторая — пошаговое рассуждение, где ошибка в одном промежуточном шаге может испортить весь ответ, даже если итог выглядит правдоподобно.
Для теста OpenAI берет MATH — набор из 12 500 олимпиадных и соревновательных задач с пошаговыми решениями. Это важная деталь: авторы сознательно уходят от более простого GSM8K и хотят проверить, помогает ли плотная обратная связь именно на более трудной математике.
Здесь же виден и прямой исследовательский вопрос. Работа DeepMind Solving math word problems with process- and outcome-based feedback в 2022 году показала, что на GSM8K process- и outcome-подходы могут давать близкие результаты по финальному ответу. OpenAI повторяет сравнение, но меняет три условия: более сильная базовая модель, больше человеческой разметки и более сложный бенчмарк MATH.
Метод
Что именно сравнивают
ORM получает метку только на уровне полного решения: ответ верный или нет. Для MATH это удобно, потому что финальный ответ обычно можно автоматически проверить. Проблема в том, что такой сигнал плохо локализует ошибку: модель знает, что решение плохое, но не знает, где именно оно сломалось.
PRM получает разметку по шагам. Разметчики видят решение модели и помечают каждый шаг как positive, negative или neutral. В версии, на которой строится основной результат, авторы в фазе 2 заканчивают разметку на первом отрицательном шаге. Тем самым для неверного решения система получает не только факт ошибки, но и ее локализацию.
Это различие напрямую связано с задачей credit assignment. Outcome supervision сообщает: «в этом длинном решении где-то есть проблема». Process supervision сообщает: «первые шаги были допустимыми, а вот здесь появилась ошибка». Для длинных цепочек это более плотный и, вероятно, более обучающий сигнал.
Как собирали данные
В large-scale режиме все модели дообучаются от базового GPT-4, который в статье описан как next-token-pretrained модель без RLHF. Для process supervision авторы собирают PRM800K на решениях, сгенерированных этим же large-scale генератором.
В приложениях работа уточняет важную для практиков деталь. Полный несфильтрованный массив содержит 1 085 590 step-level меток на 101 599 решениях. После удаления quality-control меток и незавершенных разметок для обучения остается около 800 000 меток на 75 000 решений. В основной части paper это упрощенно называется PRM800K.
Еще одна важная инженерная деталь: PRM обучается как обычная языковая модель предсказывать метку последнего шага в префиксе решения. На инференсе достаточно одного прохода по целому решению, чтобы получить step-level вероятности. Затем score полного решения считается как вероятность того, что корректны все шаги; на практике авторы реализуют это как произведение вероятностей корректности отдельных шагов.
Задача MATH
→ генератор создает много пошаговых решений
→ люди размечают шаги как positive / negative / neutral
→ обучается PRM
→ PRM считает score каждого решения
→ из N кандидатов выбирается решение с максимальным score
Large-scale и small-scale режимы
Авторы честно признают, что large-scale сравнение PRM и ORM не является полностью «яблоки к яблокам». Датасет для ORM получен иначе, он не пересекается с PRM800K и при этом на порядок больше. Поэтому кроме headline-результата они строят small-scale абляцию: используют большой PRM как источник синтетической supervision для меньших моделей и сравнивают outcome- и process-подходы уже на идентичных наборах данных.
Результаты
Ключевой headline-результат получается не на стандартном full-test MATH, а на собственном удержанном подмножестве из 500 задач. Причина такая: чтобы уменьшить переобучение на исходных 7 500 train-задачах MATH, авторы добавляют в обучение еще 4 500 задач из исходного test split и оценивают модели только на оставшихся 500, выбранных случайно и, по их утверждению, репрезентативных.
| Набор / протокол | ORM | PRM | Базовый метод | Что это значит |
|---|---|---|---|---|
| MATH, удержанное подмножество, best-of-1860 | 72,4% | 78,2% | Majority voting: 69,6% | PRM лучше выбирает правильное решение из большого пула кандидатов |
| Свежие STEM-экзамены, aggregate, best-of-100 | 63,8% | 72,9% | Majority voting: 61,3% | PRM сохраняет преимущество и на более свежих задачах вне MATH |
Для практики здесь важны две вещи. Во-первых, PRM выигрывает не только у ORM, но и у сильного базового majority-voting baseline. Во-вторых, по графику Figure 3 разрыв между PRM и альтернативами не сужается, а растет с увеличением числа проверяемых кандидатных решений N. Иначе говоря, чем больше test-time search, тем больше ценность хорошего верификатора.
Small-scale часть нужна, чтобы отделить эффект «лучше данных» от эффекта «лучше типа supervision». Там авторы пишут, что process supervision заметно превосходит обе формы outcome supervision на всех масштабах сбора данных, если сравнивать модели, обученные на одинаковых по структуре датасетах. В той же серии абляций активный отбор наиболее убедительных неверных решений дает оценку выигрыша по эффективности разметки примерно в 2,6 раза относительно равномерного сэмплирования.
Есть и любопытная редакционная деталь в OOD-разделе. Текст paper говорит о held-out наборе из 224 STEM-вопросов, но сумма по строкам таблицы дает 234 задачи: 45 по AP Calculus, 60 по AP Chemistry, 45 по AP Physics и 84 по AMC10/12. Поскольку эта несостыковка повторяется и в arXiv-версии, и в conference-версии, корректнее воспринимать aggregate-результат как результат таблицы, но помнить о внутренней неточности оформления.
Интерпретация
Что фактически показала работа
Факт из источника такой: если задача допускает разбиение на шаги, а у вас есть возможность получить step-level разметку, то process reward model оказывается более надежным инструментом выбора решений, чем reward model, обученная только по правильности финального ответа. Причем это видно не только в headline-результате, но и в контролируемой абляции, где тип supervision меняется при прочих равных.
Почему так происходит, авторы объясняют через credit assignment. Для сложных задач большинство длинных решений содержит ошибку где-то внутри. Outcome-метка «неверно» сообщает слишком мало, тогда как process-метка сообщает, сколько первых шагов были допустимыми и где именно решение ушло не туда.
Наш комментарий
На наш взгляд, сильнейшая часть paper — не сама цифра 78,2%, а смена оптики. Авторы рассматривают reasoning не только как генерацию, но и как задачу поиска с проверкой: сначала сгенерировать много кандидатов, затем надежно отобрать лучший. Это делает работу особенно важной для практических систем, где генератор и верификатор можно улучшать отдельно.
Но столь же важно и то, чего paper не доказывает. Он не показывает, что step-by-step supervision универсально делает модель «честно рассуждающей». Он показывает более узкий, но ценный результат: в математике, при наличии формата пошагового решения и достаточного бюджета на разметку, награда за шаги помогает лучше ранжировать кандидатов и локализовать ошибки.
Ограничения
- Large-scale сравнение не идеально сопоставимо. Авторы сами пишут, что обучающие наборы для ORM и PRM различаются: PRM-датасет собран активным отбором, смещен в сторону answer-incorrect решений и меньше по размеру, тогда как ORM-датасет на порядок больше.
- Использован нестандартный split MATH. В обучение включены 4 500 задач из исходного test split, а оценка ведется только на оставшихся 500. Поэтому headline-числа этой работы нельзя механически сопоставлять с обычными leaderboard-результатами по исходному MATH.
- MATH особенно чувствителен к false positives для answer-only оценки. Если неверное рассуждение случайно приводит к правильному ответу, ORM получает искаженный target. Авторы даже отдельно отмечают, что outcome supervision через PRMlarge может быть более релевантным baseline, чем простая проверка финального ответа.
- Генерализация вне математики не доказана. И paper, и пост OpenAI прямо говорят, что неизвестно, насколько хорошо результат переносится за пределы математических задач.
- Риск contamination полностью не снят. Авторы проводили decontamination для MathMix, но признают, что тонкие формы пересечения с MATH через интернет-перефразировки исключить нельзя.
- В OOD-разделе есть внутренняя несостыковка. Текст пишет о 224 вопросах, а таблица суммируется в 234. Это не отменяет направления результата, но снижает аккуратность отчетности.
Вывод
«Let’s Verify Step by Step» показала убедительный и довольно практичный тезис: для длинных математических цепочек reward model полезнее учить не только на факте успеха, но и на локализации ошибки по шагам. Именно поэтому PRM лучше работает как верификатор и реранкер большого числа кандидатных решений.
Для практиков главный урок не в том, что «всегда нужен PRM», а в том, что качество reasoning-системы часто упирается в качество проверки промежуточных состояний. Если домен допускает шаги, метки и search over candidates, dense supervision может оказаться более выгодной, чем редкий бинарный сигнал по финальному ответу.
Источники
- Let’s Verify Step by Step — Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, Karl Cobbe.
- Published as a conference paper at ICLR 2024: Let’s Verify Step by Step.
- Improving mathematical reasoning with process supervision — исследовательский пост OpenAI от 31 мая 2023 года.
- PRM800K: A Process Supervision Dataset — официальный репозиторий датасета OpenAI.
- Measuring Mathematical Problem Solving With the MATH Dataset — Dan Hendrycks и соавт.
- GitHub – hendrycks/math: The MATH Dataset — репозиторий MATH.
- Solving math word problems with process- and outcome-based feedback — J. Uesato и соавт.
- Improving Mathematical Reasoning with Process Supervision – Video — выступление Hunter Lightman на OpenAI Forum.
FAQ
Чем PRM отличается от ORM в этой работе?
ORM оценивает только полное решение по финальному ответу. PRM оценивает каждый шаг и затем сворачивает step-level вероятности в score полного решения.
Показала ли работа, что process supervision всегда лучше?
Нет. Источник показывает преимущество на математических задачах с пошаговыми решениями и подчеркивает, что переносимость за пределы этого домена неизвестна.
Почему здесь так важен best-of-N?
Потому что paper меряет не только качество генератора, но и качество верификатора. Чем лучше reward model умеет распознавать корректное решение среди многих кандидатов, тем больше пользы она извлекает из дополнительного test-time search.
