Запись архива

OpenAI представила o1 с «цепочкой мыслей»: что изменилось в генерации рассуждений

Модель OpenAI o1 использует внутреннюю «цепочку мыслей» для решения сложных задач. Разбираем архитектурные особенности, тесты производительности и ограничения новой парадигмы рассуждений.

Интерфейс OpenAI o1 с демонстрацией цепочки рассуждений
Интерфейс OpenAI o1 с демонстрацией цепочки рассуждений
Редакционная тематическая обложка COMRAD404

OpenAI выпустила модель o1 (ранее известную под кодовым названием Strawberry) — первую в семействе «рассуждающих» LLM. В отличие от GPT-4o, которая генерирует ответ сразу, o1 тратит дополнительное вычислительное время на внутреннюю «цепочку мыслей» (chain-of-thought), прежде чем выдать финальный результат. Этот подход приближает модель к тому, как человек обдумывает сложную задачу: пробует разные пути, возвращается к исходным данным и корректирует ход рассуждений.

Для практиков ИИ и разработчиков это означает сдвиг: теперь можно делегировать модели задачи, требующие многошаговой логики, без необходимости вручную прописывать промпты с пошаговыми инструкциями. Однако у подхода есть и обратная сторона — время ожидания и стоимость.

Как работает внутренняя цепочка мыслей в o1

Ключевое архитектурное отличие o1 — это обучение с подкреплением (reinforcement learning) на этапе рассуждения. Модель учится распознавать, какие мыслительные шаги ведут к правильному ответу, а какие — в тупик. В процессе инференса она генерирует последовательность внутренних токенов, которые не видны пользователю, но формируют финальный ответ.

OpenAI не раскрывает полную архитектуру, но из технического превью следует, что o1 использует «цепочку мыслей» как внутренний механизм, а не как внешний промпт. Это значит, что модель сама решает, когда и как «размышлять», а пользователь видит только сжатый итог.

На практике это выглядит так: на сложный математический вопрос o1 может потратить в 5–10 раз больше времени на генерацию, чем GPT-4o, но при этом дать верный ответ там, где предыдущая модель ошибалась.

Сравнение производительности: o1 против GPT-4o

OpenAI опубликовала результаты бенчмарков, которые демонстрируют значительный прирост в задачах, требующих логического вывода.

Бенчмарк GPT-4o o1 Разница
AIME 2024 (математика) 12% 74% +62 п.п.
Codeforces (программирование) 11-й перцентиль 89-й перцентиль +78 п.п.
GPQA Diamond (научные вопросы) 56% 78% +22 п.п.
MATH-500 76% 94% +18 п.п.

Особенно впечатляет результат на AIME 2024 — наборе задач американской математической олимпиады. Если GPT-4o решала лишь 12% задач, то o1 справляется с 74%. Для сравнения: средний участник олимпиады набирает около 20%. При этом o1 не просто угадывает ответ — она демонстрирует последовательные шаги решения.

Где o1 превосходит предшественников, а где нет

Сильные стороны o1:

  • Математика и логика: задачи с многошаговыми вычислениями, доказательства, комбинаторика.
  • Программирование: генерация сложных алгоритмов, отладка, рефакторинг кода с учётом контекста.
  • Научные рассуждения: вопросы из физики, химии, биологии, требующие синтеза знаний.
  • Планирование: задачи, где нужно разбить цель на подзадачи и проверить выполнимость каждой.

Слабые стороны:

  • Скорость: o1 отвечает медленнее. В чате это может раздражать, в API — увеличивать latency.
  • Стоимость: токены внутреннего рассуждения тарифицируются. OpenAI пока не раскрыла точные цены, но по оценкам ранних тестеров, o1 может быть в 3–5 раз дороже GPT-4o.
  • Фактологическая точность: как и другие LLM, o1 может уверенно рассуждать о неверных фактах. «Цепочка мыслей» не гарантирует истинности посылок.
  • Прозрачность: пользователь не видит внутренние шаги. Это затрудняет отладку и проверку логики.

Ограничения и что стоит учитывать

OpenAI подчёркивает, что o1 — это превью, а не финальный продукт. Модель лучше всего работает в задачах, где «правильный ответ можно проверить формально» — математика, код, научные вычисления. Для творческого письма, перевода или общих вопросов GPT-4o остаётся предпочтительнее.

Важно: o1 может «перерассуждать» простые задачи. Если вы спросите «сколько будет 2+2», модель может потратить лишние секунды на внутренние размышления, хотя ответ очевиден. Разработчикам стоит учитывать это при проектировании промптов: для простых запросов лучше использовать более лёгкие модели.

Также стоит помнить, что внутренняя цепочка мыслей не делает модель неуязвимой для ошибок. В тестах сообщества o1 иногда давала неверные ответы на задачи, где требовалось знание актуальных событий или специфических контекстов, выходящих за пределы её обучающих данных.

Что делать разработчикам и исследователям

Если вы работаете с задачами, где критична логическая последовательность — математические модели, верификация кода, научные вычисления — o1 стоит протестировать в вашем пайплайне. Особенно если вы уже используете chain-of-thought промпты в GPT-4o: o1 может дать такой же или лучший результат без ручного прописывания шагов.

Для экспериментов OpenAI предоставила доступ к o1-preview и o1-mini через API. o1-mini — облегчённая версия, которая дешевле и быстрее, но показывает сопоставимые результаты на задачах по программированию и математике.

Перед интеграцией проверьте: действительно ли ваша задача требует глубокого рассуждения? Если да — o1 может сэкономить часы на промпт-инжиниринге. Если нет — вы переплатите за latency и токены.

Полезно также следить за обновлениями в репозитории OpenAI и сообществе: архитектура «цепочки мыслей» активно исследуется, и уже появляются альтернативные реализации с открытым исходным кодом, которые могут предложить более гибкие решения.