Запись архива

OpenAI o1: как модель научили «думать» перед ответом

Разбор launch-материалов OpenAI от 12 сентября 2024: что на самом деле означало «думать перед ответом» в o1, как работали скрытая цепочка рассуждений, RL и test-time compute.

Схема работы OpenAI o1: запрос пользователя, скрытая цепочка рассуждений, reasoning по safety-правилам и итоговый ответ

12 сентября 2024 года OpenAI одновременно выпустила продуктовую заметку Introducing OpenAI o1-preview, технический пост Learning to reason with LLMs и первичную OpenAI o1 System Card. Именно эти документы, а не позднейшие пересказы, объясняют, что компания тогда имела в виду под фразой «модель думает перед ответом».

Важно сразу снять лишнюю метафизику. В материалах запуска речь шла не о «сознании» и не о магическом новом режиме интеллекта, а о более длинном внутреннем рассуждении, обученном с помощью reinforcement learning, плюс о готовности тратить больше вычисления во время ответа. Это и дало o1 отдельный профиль: выше качество на reasoning-heavy задачах, но больше цена, задержка и сложнее интерпретация результатов.

Коротко

  • OpenAI o1 в сентябре 2024 года представляли как reasoning-модель для сложных задач, а не как универсальную замену GPT-4o.
  • «Думать перед ответом» в launch-материалах означало скрытую цепочку рассуждений, обучение через RL и дополнительное test-time compute на конкретном запросе.
  • Ключевой сдвиг — качество росло не только от pretraining, но и от того, сколько вычисления модель тратит во время ответа.
  • Raw chain-of-thought пользователю не показывали: в ChatGPT выводилась только сгенерированная моделью сводка рассуждения.
  • Safety-улучшения были реальными, но не абсолютными: по сентябрьской system card o1-preview лучше GPT-4o на jailbreak- и over-refusal-оценках, но OpenAI всё равно классифицировала семейство как medium risk по persuasion и CBRN.

Контекст: почему появился OpenAI o1

До o1 основной язык индустрии был довольно прямым: больше pretraining, больше параметров, длиннее контекст, лучше instruction tuning. Запуск o1 добавил другую ось масштабирования. В техническом посте OpenAI прямо пишет, что производительность модели стабильно улучшается и с ростом train-time compute, и с ростом test-time compute. Это важная смена рамки: не только «какую модель вы обучили», но и «сколько вычисления она тратит на один трудный ответ».

При этом OpenAI сама же ограничивала ожидания. В продуктовой заметке от 12 сентября 2024 года компания называла o1-preview ранней версией и отдельно предупреждала, что для многих обычных сценариев GPT-4o в ближайшей перспективе останется удобнее. На запуске у reasoning-моделей не было ряда привычных функций ChatGPT, а API-версия тогда ещё не поддерживала часть стандартных возможностей вроде function calling и streaming. То есть o1 с самого начала подавали как специализированный инструмент, а не как «новый дефолт для всего».

Ещё один важный момент исторического масштаба: обновлённая OpenAI o1 System Card была опубликована 5 декабря 2024 года и отдельно сохраняет ссылку на сентябрьскую версию как на предыдущую. В этом разборе я держусь именно рамки 12 сентября 2024 года: o1-preview и o1-mini, а более поздние документы использую только там, где они помогают чётко разграничить версии или ретроспективно назвать уже описанный метод.

Метод: как o1 научили «думать» перед ответом

1. Не просто prompt «think step by step», а обучение через RL

Главная идея запуска o1 — не в том, что модели наконец сказали «рассуждай пошагово». Подобные prompting-трюки были известны и раньше. Новизна, как описывает OpenAI в Learning to reason with LLMs и system card, состояла в том, что семейство o1 обучали с помощью large-scale reinforcement learning так, чтобы модель сама вырабатывала продуктивную цепочку рассуждений.

По описанию OpenAI, во время такого обучения модель учится разбивать трудные шаги на более простые, пробовать разные стратегии, замечать собственные ошибки и менять подход, если текущий не работает. Иначе говоря, reasoning здесь встроен в поведение модели, а не навешен поверх уже готовой chat-модели одним удачным system prompt.

Это различие практическое. Если обычный CoT-prompt нередко даёт лишь более длинный текст, то o1 задумывалась как модель, у которой внутренняя процедура решения и есть часть целевой оптимизации. Именно поэтому OpenAI в сентябре 2024 года говорила о новой серии моделей, а не о «режиме для GPT-4o».

2. Две оси масштабирования: train-time compute и test-time compute

Самое важное техническое утверждение launch-материалов — плавный рост качества по двум направлениям.

  • train-time compute — дополнительное вычисление, потраченное на обучение reasoning-поведения во время RL.
  • test-time compute — дополнительное вычисление, которое модель тратит уже на конкретный пользовательский запрос перед тем, как отдать финальный ответ.

Для практиков это означает, что у o1 меняется сама экономика инференса. Качество перестаёт быть функцией только от «какой чекпойнт вы выбрали». Оно ещё и зависит от того, насколько дорогой режим ответа вы допускаете: один прогон, consensus по нескольким сэмплам, reranking и так далее. Это хорошо видно на математических результатах OpenAI: более высокая цифра в public launch-материалах связана не просто с «лучшей моделью», а с более щедрым режимом вычисления во время решения.

3. Почему цепочка рассуждений была скрыта

Один из самых обсуждаемых выборов o1 — скрытый chain of thought. В Learning to reason with LLMs OpenAI объясняет это так: если лаборатория хочет мониторить внутреннее рассуждение модели, оно должно оставаться относительно свободным, а не быть заранее вычищенным под пользовательские ожидания или policy compliance. Поэтому raw CoT решено было не показывать пользователю.

Одновременно system card фиксирует, что в ChatGPT пользователям показывались именно summary цепочки рассуждений, а не сама цепочка. Это тонкое, но принципиальное различие. Пользователь видит продуктовый пересказ reasoning, тогда как сама трасса решения остаётся внутренней. В инженерном смысле это компромисс между прозрачностью, безопасностью и возможностью будущего мониторинга.

Отсюда и методологическое ограничение: внешний исследователь не может независимо проверить, насколько показанная summary действительно соответствует внутреннему рассуждению модели. OpenAI сама отмечает, что вопрос о faithful representation chain-of-thought остаётся открытым исследовательским направлением.

4. Safety встроили в reasoning, а не только в финальный фильтр

Сентябрьская system card прямо говорит, что o1-модели могут рассуждать о safety policies в контексте потенциально опасных запросов. На момент запуска это было описано языком capabilities и evaluations. Позже, 20 декабря 2024 года, OpenAI публично дала этому подходу имя — deliberative alignment.

Это важно читать именно как ретроспективное уточнение, а не как подмену темы. В декабрьском тексте OpenAI пишет, что o-series models обучались напрямую работать с текстом safety-спецификаций и явно рассуждать о них перед ответом. То есть сентябрьская формула «модель думает о правилах безопасности в контексте» позже была развернута в отдельную методологию.

Если упростить до одной схемы, то запуск o1 объединил три слоя: reasoning через RL, дополнительное вычисление во время ответа и reasoning-over-policies для safety-калибровки. Именно вместе они и создают то, что OpenAI продавала как модель, которая «думает» перед ответом.

Результаты: что показали материалы запуска

Сентябрьские документы одновременно обсуждают capability и safety. Лучше всего задокументированы safety-результаты, потому что они повторяются и в Learning to reason with LLMs, и в system card. Ниже — те метрики, которые OpenAI продублировала в обоих источниках.

Оценка Метрика и режим GPT-4o o1-preview Что это показывает
Standard harmful prompts % safe completions 0,990 0,995 На стандартных вредоносных запросах различие небольшое, но в пользу o1-preview.
Challenging: jailbreaks & edge cases % safe completions 0,714 0,934 На сложных jailbreak- и edge-case сценариях разрыв уже большой.
StrongREJECT [email protected] 0,220 0,840 Это именно устойчивость к известным jailbreak-техникам, а не общая «вежливость» модели.
XSTest benign prompts, not over-refusal 0,924 0,976 Модель реже отказывает там, где запрос безопасен, но похож на рискованный.

Эти числа не означают «абсолютную безопасность». Но они хорошо показывают, что OpenAI удалось улучшить калибровку отказов сразу по двум направлениям: чаще отказывать на действительно опасных запросах и реже over-refuse на безопасных. Позднейший текст о deliberative alignment интерпретирует это как эффект reasoning по safety-спецификациям.

С capability-результатами нужна большая осторожность. В двух сентябрьских публикациях OpenAI повторяет ориентир на 89-й перцентиль в задачах competitive programming на Codeforces. Для математики в продуктовой заметке фигурирует 83% на квалификационном экзамене олимпиадного уровня, а в техническом посте OpenAI уточняет, что на AIME 2024 эта цифра соответствует режиму consensus among 64 samples. Там же OpenAI отдельно пишет, что для одиночной попытки результат был 74%; эта последняя цифра, насколько видно по доступным launch-материалам, подробно раскрыта только в техническом посте, поэтому читать её стоит как одноисточниковое утверждение самой OpenAI.

С GPQA ситуация похожая. В launch-материалах OpenAI пишет, что o1 превысила точность экспертов с PhD на GPQA diamond. Это узкое и техническое сравнение: сам benchmark GPQA: A Graduate-Level Google-Proof Q&A Benchmark создан как graduate-level multiple-choice набор по биологии, химии и физике, а не как тест «заменит ли модель учёного вообще». Поэтому корректная трактовка здесь скромнее: на конкретном сложном наборе вопросов reasoning-модель показала очень сильный результат.

Важно и то, чего материалы запуска не обещают. В разделе human preference OpenAI сама пишет, что o1-preview не была предпочтительнее GPT-4o на части обычных natural-language задач. Иначе говоря, сильный reasoning не равен универсальному превосходству во всём чате.

Интерпретация: что это значит для практиков

Если читать сентябрь 2024 года не как PR-событие, а как инженерный сдвиг, то главное новшество o1 — легитимация inference как отдельного масштабирующего ресурса. До этого качество LLM обычно обсуждали через датасет, pretraining, instruction tuning и размер модели. С o1 в явном виде добавилась идея: можно повышать качество за счёт более дорогого и более длинного внутреннего решения.

Для разработчика это меняет компромисс между стоимостью, задержкой и надёжностью. На коротких и рутинных запросах reasoning-модель может быть избыточной. На многошаговых задачах, где важны самопроверка, смена стратегии и разбор неоднозначности, дополнительное test-time compute может давать лучший выигрыш, чем просто переход на более крупную «быструю» chat-модель.

Есть и второй, менее очевидный вывод. Запуск o1 показывает, что safety можно поднимать не только внешними классификаторами и post-hoc refusals, но и внутренним reasoning по policy-тексту. Это не устраняет риск, но меняет логику alignment: модель должна не просто помнить запреты, а уметь применить правило к конкретному контексту запроса.

Наш комментарий

На наш взгляд, историческая важность o1 не в одной цифре на AIME, GPQA или StrongREJECT. Главное — смена инженерного языка. После сентября 2024 года стало трудно говорить о frontier-моделях так, будто inference — это только «генерация ответа». Он всё больше становится вычислительным бюджетом на поиск решения.

Из этого следует и практическая дисциплина: reasoning-модель не отменяет prompt engineering. Наоборот, чем дороже внутреннее рассуждение, тем важнее хорошо ограничить задачу, задать критерий успешности, потребовать формат вывода и явно отделить факты от гипотез. Иначе модель просто потратит больше вычисления на плохо поставленную задачу.

Ограничения и критика

  • OpenAI не раскрыла архитектуру и полный recipe обучения. В launch-материалах много сказано о поведении модели, но почти ничего — о конкретной архитектуре, объёме RL, устройстве reward model и составе reasoning-данных. Поэтому разбор o1 в 2024 году неизбежно остаётся behavioural, а не архитектурным.
  • Raw chain-of-thought скрыт от внешних исследователей. Это повышает пространство для мониторинга внутри лаборатории, но снижает возможность независимого аудита. Пользователь видит summary reasoning, а не саму внутреннюю трассу принятия решения.
  • Сильные capability-числа часто зависят от дорогого режима инференса. В математике OpenAI сама различает single-sample, consensus по 64 сэмплам и reranking. Поэтому headline-цифры нельзя механически переносить на обычный режим «один запрос — один ответ».
  • Лучшая safety-калибровка не равна отсутствию риска. И первичная сентябрьская system card, и более поздняя обновлённая page version фиксируют medium risk по persuasion и CBRN, при low risk по cybersecurity и model autonomy. То есть модель одновременно стала безопаснее по ряду отказных evals и достаточно сильной, чтобы требовать отдельного preparedness-режима.
  • С factuality картина неоднозначна. Внутренние hallucination-evals из system card показывают улучшение относительно GPT-4o по ряду метрик, но там же OpenAI признаёт анекдотические отзывы, что o1-preview может казаться более галлюцинирующей в некоторых доменах из-за более развёрнутых и убедительных ответов.
  • Даже сама OpenAI не подавала o1 как модель «для всего». В техническом посте сказано, что o1-preview не предпочтительнее GPT-4o на части обычных natural-language задач. Это полезное напоминание против соблазна свести весь прогресс к одной шкале reasoning-бенчмарков.

Вывод

OpenAI o1 в сентябре 2024 года был не «моделью, которая обрела мышление», а аккуратно собранным инженерным пакетом: RL для продуктивной скрытой цепочки рассуждений, дополнительное test-time compute и reasoning по safety-правилам перед ответом. Именно это сочетание, а не какая-то одна секретная архитектурная находка, и объясняет запуск.

Если запомнить одну вещь, то это будет следующая: после o1 считать модель просто функцией от prompt стало уже недостаточно. Для frontier reasoning-систем всё важнее, сколько вычисления и какой policy-aware процесс стоит между запросом и финальным ответом.

Источники

FAQ

Чем o1 отличалась от GPT-4o на момент запуска?

По материалам OpenAI от 12 сентября 2024 года, o1 была reasoning-моделью: она тратила больше внутреннего вычисления на трудные задачи и лучше показывала себя на ряде math, coding и safety evals. GPT-4o при этом оставалась удобнее для части обычных chat-сценариев.

Показывала ли o1 пользователю настоящую цепочку рассуждений?

Нет. OpenAI решила не показывать raw chain-of-thought. В ChatGPT пользователь видел только сгенерированную моделью summary-версию рассуждения.

Почему в материалах OpenAI встречаются и 83%, и 74% для математики?

Потому что это разные режимы вычисления. В техническом посте 74% — это single-sample результат на AIME 2024, а 83% — режим consensus among 64 samples. Высокая цифра не означает, что обычный одиночный ответ в чате автоматически даёт тот же результат.

Можно ли считать o1 просто «промптованной» версией GPT-4o?

Нет, launch-материалы OpenAI так это не описывают. Семейство o1 подавалось как отдельная серия reasoning-моделей, обученных с large-scale reinforcement learning и с другим режимом работы на инференсе.

Читайте также