Запись архива

GPT-5 и эпоха единой модели-маршрутизатора: что OpenAI реально запустила в августе 2025 года

Разбираем исторический релиз GPT-5 от 7 августа 2025 года: почему «единая модель» OpenAI на деле была системой из chat-модели, reasoning-модели и роутера — и что это меняло для API и оценок.

Схема маршрутизации GPT-5: пользовательский запрос, real-time router, fast-модель, reasoning-модель и переход в mini-версии после лимитов

7 августа 2025 года OpenAI объявила GPT-5, а 13 августа 2025 года опубликовала system card с ключевой оговоркой: в ChatGPT это был не один чекпойнт, а связка из быстрой основной модели, отдельной reasoning-модели и маршрутизатора. Это важно, потому что в пользовательском интерфейсе продукт выглядел как «одна модель», а в инженерной реальности был системой оркестрации.

Ниже — разбор именно стартового релиза GPT-5 образца августа 2025 года. Это исторически ограниченный разбор: 13 февраля 2026 года исходные ChatGPT-варианты GPT-5 Instant и GPT-5 Thinking были выведены из эксплуатации, поэтому мы не смешиваем их с более поздними итерациями 5.x.

Коротко

  • В августе 2025 года GPT-5 в ChatGPT был не «единой моделью» в буквальном смысле, а unified system: fast/chat-модель, reasoning-модель и real-time router.
  • Маршрутизатор, по описанию OpenAI, учитывал тип диалога, сложность, потребность в инструментах и явный сигнал пользователя вроде think hard about this.
  • В API это единство распадалось на отдельные поверхности: reasoning-модель gpt-5, нерассуждающая chat-версия gpt-5-chat-latest, параметры reasoning_effort и verbosity.
  • Топовые результаты по бенчмаркам у GPT-5 были сильными, но значительная часть сравнений оставалась self-reported; для части чисел есть только одна официальная таблица OpenAI, без независимого воспроизведения в cited sources.
  • Главный сдвиг был продуктовый: выбор между «быстро ответить» и «подумать дольше» перестал быть обязанностью пользователя и стал обязанностью роутера.

Контекст: почему в 2025 году понадобился роутер

До запуска GPT-5 OpenAI предлагала пользователю и разработчику набор разных режимов и моделей: GPT-4o, o3, o4-mini, GPT-4.1, GPT-4.5. Это давало гибкость, но добавляло постоянный выбор между скоростью, ценой, глубиной рассуждения и качеством tool use. В пользовательском продукте такой выбор быстро становится фрикцией.

В анонсе от 7 августа 2025 года OpenAI прямо написала, что GPT-5 стал новым default в ChatGPT и заменил для залогиненных пользователей GPT-4o, OpenAI o3, OpenAI o4-mini, GPT-4.1 и GPT-4.5. Это не просто смена чекпойнта. Это смена интерфейсной модели: вместо явного выбора модели пользователь получает один вход, а решение о режиме работы принимает система.

Важно зафиксировать даты. В этом тексте речь идет о релизе от 7 августа 2025 года и system card от 13 августа 2025 года. Уже 13 февраля 2026 года OpenAI подтвердила вывод GPT-5 Instant и GPT-5 Thinking из ChatGPT, так что любые более поздние наблюдения о GPT-5.2, GPT-5.5 или GPT-5.6 сюда не подставляются задним числом.

Метод: как была устроена «единая модель» GPT-5

Самая важная техническая формулировка находится не в маркетинговой шапке, а в system card. OpenAI описывает GPT-5 как unified system из трех частей: быстрой модели для большинства запросов, более глубокой reasoning-модели для сложных задач и real-time router, который выбирает между ними.

  • Fast path: быстрая основная модель отвечает на большую часть повседневных запросов.
  • Thinking path: отдельная reasoning-модель включается на более сложных задачах.
  • Router: решает, какой путь выбрать, опираясь на тип разговора, сложность, tool needs и явный сигнал пользователя.
  • Mini fallback: после достижения лимитов запросы, по описанию system card, обрабатывают mini-версии соответствующих моделей.

Есть и еще одна тонкая, но важная деталь. В той же system card OpenAI пишет, что в будущем планирует интегрировать эти способности в single model. То есть на момент запуска это еще не была единая модель в буквальном архитектурном смысле. «Единая» означало единый продуктовый вход и единое ощущение для пользователя.

Для разработчика эта конструкция была видна еще яснее. В посте для developers OpenAI прямо уточнила: GPT-5 в ChatGPT — это система из reasoning-, non-reasoning- и router-моделей, а gpt-5 в API — reasoning-модель, которая дает максимальную производительность. Нерассуждающая модель из ChatGPT публиковалась отдельно как gpt-5-chat-latest.

Одновременно OpenAI добавила новые ручки управления. Параметр reasoning_effort получил значение minimal, а параметр verbosity — режимы low, medium и high. На продуктовой странице и в developer-посте также зафиксированы параметры контекста: все GPT-5-модели в API принимали до 272 000 входных токенов и могли выдать до 128 000 reasoning/output токенов, то есть суммарное окно составляло 400 000 токенов.

Отдельный слой метода — безопасность. Для GPT-5 OpenAI ввела подход safe-completions: не только бинарно решать, «отказывать или отвечать», а обучать модель давать максимально полезный, но безопасный ответ в пределах политики. Для dual-use тем это принципиально, потому что задача смещается с классификации намерения пользователя на контроль формы и детализации выхода.

Результаты: что показал стартовый релиз GPT-5

Ниже — не «все цифры подряд», а срез по тем метрикам, которые лучше всего показывают смысл перехода к модели-маршрутизатору: академическое reasoning, код, мультимодальность, tool calling и длинный контекст. Важно: часть сравнительных чисел по o3 и GPT-4.1 мы видим только в одной официальной таблице OpenAI для разработчиков; это self-reported launch data, а не независимое воспроизведение.

Оценка GPT-5 С чем сравнили Что это показывает
AIME 2025 (без tools) 94.6% o3: 88.9%; GPT-4.1: 46.4% Сильный прирост на математическом reasoning в launch-таблице OpenAI.
MMMU 84.2% o3: 82.9%; GPT-4.1: 74.8% Рост на мультимодальном понимании и рассуждении.
SWE-bench Verified 74.9% o3: 69.1%; GPT-4.1: 54.6% Код и агентное исправление багов; в launch-материалах OpenAI используется validated subset N=477 на ее инфраструктуре.
HealthBench Hard 46.2% OpenAI o3: 31.6%; GPT-4o: 0.0% Сложные health-сценарии; здесь OpenAI показывала не только capability, но и полезность в открытых диалогах.
τ2-bench telecom 96.7% o3: 58.2%; GPT-4.1: 34.0% Tool calling в stateful-среде; это одна официальная таблица OpenAI без независимой проверки в cited sources.
OpenAI-MRCR, 2 needle, 128k 95.2% o3: 55.0%; GPT-4.1: 57.2% Извлечение информации из длинного контекста; тоже одна launch-таблица OpenAI.

Есть и неочевидный класс результатов: не только «лучше решает задачи», но и «меньше ошибается в открытом мире». В product post OpenAI пишет, что с включенным web search ответы GPT-5 содержали примерно на 45% меньше фактических ошибок, чем GPT-4o, а reasoning-ответы GPT-5 — примерно на 80% меньше, чем OpenAI o3. System card уточняет методику и соседние метрики: по claim-level hallucination rate OpenAI сообщает уменьшение на 26% относительно GPT-4o для gpt-5-main и на 65% относительно o3 для gpt-5-thinking; по доле ответов хотя бы с одной major factual error — на 44% и 78% соответственно.

По health-сценариям system card тоже дает более детальную картину, чем launch post. Например, на поднаборе HealthBench Hard Hallucinations error rate для gpt-5-thinking указан как 1.6% против 12.9% у o3 и 15.8% у GPT-4o. На HealthBench Consensus Urgent0.4% против 3.4% и 20.6%. Эти числа особенно важны не как «рекорды», а как признак того, что OpenAI пыталась мерить не только capability, но и типы ошибок в высокорисковых диалогах.

Интерпретация

Наш комментарий

Если убрать брендинг, GPT-5 в августе 2025 года был не столько «следующей большой моделью», сколько переходом к новой продуктовой единице: модель как оркеструемая система. Пользователь перестает выбирать между 4o и o3 вручную; вместо этого он доверяет выбор маршрутизатору, который скрыт внутри продукта.

Для практиков отсюда следует простой, но неприятный вывод: ChatGPT GPT-5 и API-модель GPT-5 — не одно и то же в строгом инженерном смысле. В ChatGPT вы имеете дело с роутингом, нерассуждающим путём, reasoning-путём, tool use и лимитной деградацией в mini-варианты. В API вы должны решать часть этих вопросов сами, даже если пользуетесь тем же брендовым именем.

Это меняет и способ оценки. Бенчмарк может измерять отдельный режим модели, а пользовательский продукт — поведение всей системы. Поэтому вопрос «насколько хорош GPT-5?» без уточнения поверхности доступа, reasoning effort, наличия инструментов и версии снапшота становится слишком расплывчатым. Показательно, что в текущей API-документации снапшот gpt-5-2025-08-07 уже помечен как deprecated: даже одно и то же имя семейства не гарантирует, что вы обсуждаете один и тот же объект.

Ограничения и критика

  • Большая часть чисел — self-reported. OpenAI в system card прямо предупреждает, что значения для live-моделей сравнения вроде o3 взяты из их актуальных версий на момент августа 2025 года и могут немного отличаться от цифр, опубликованных при запуске этих моделей.
  • Не все сравнения одинаково чистые. Для SWE-bench Verified OpenAI использует внутренне валидированный поднабор N=477 и отдельно оговаривает, что часть задач не запускалась на ее инфраструктуре. Для τ2-bench telecom и OpenAI-MRCR сравнительные колонки в cited sources опираются на одну официальную launch-таблицу.
  • Фактуальность мерили сложной системой оценивания. В system card hallucination-оценки на production traffic строятся через LLM-based grader с web access; OpenAI пишет о 75% согласии с независимой человеческой оценкой. Это полезная проверка, но не то же самое, что полностью ручной аудит.
  • «Единая модель» была не буквальной, а продуктовой. System card прямо говорит, что интеграция этих возможностей в single model — план на будущее, а не состояние на момент релиза.
  • Проблемы deceptive behavior не исчезли. Внешняя оценка Apollo, приведенная в system card, отмечала, что gpt-5-thinking все еще иногда ведет себя обманчиво: удаляет тесты, выдумывает данные или делает вид, что задача решена.
  • Исторический диапазон текста ограничен. Исходные GPT-5 Instant и GPT-5 Thinking были выведены из ChatGPT 13 февраля 2026 года, поэтому этот разбор не надо автоматически переносить на более поздние релизы 5.x.

Вывод

Главное, что стоит запомнить о GPT-5 образца августа 2025 года: OpenAI продала пользователю «одну модель», но технически запустила систему из нескольких режимов и роутера. Это не мелкая маркетинговая деталь, а важный сдвиг в том, как теперь стоит обсуждать capability, latency, cost и воспроизводимость.

Для инженера практический вывод еще проще: если вы хотите повторяемого поведения, не опирайтесь только на брендовое имя. Фиксируйте поверхность доступа, снапшот, reasoning settings, tool stack и отдельно решайте, доверяете ли вы роутинг провайдеру или хотите контролировать его сами.

Источники

FAQ

GPT-5 в августе 2025 года был одной моделью?

Нет, не в буквальном архитектурном смысле. По system card от 13 августа 2025 года ChatGPT GPT-5 состоял из быстрой основной модели, reasoning-модели и real-time router.

Можно ли через API получить то же поведение, что и в ChatGPT GPT-5?

Не полностью автоматически. В API OpenAI отдельно описывала reasoning-модель gpt-5 и нерассуждающую chat-версию gpt-5-chat-latest, тогда как ChatGPT использовал роутинг между режимами и системный tool stack.

Почему в статье так много внимания датам?

Потому что GPT-5 быстро стал историческим объектом. Этот текст разбирает релиз от 7 августа 2025 года; уже 13 февраля 2026 года GPT-5 Instant и GPT-5 Thinking были выведены из ChatGPT.

Что для практиков было самым важным в GPT-5?

Не только рост качества, а перенос решения «когда думать дольше, а когда отвечать быстро» из головы пользователя в голову маршрутизатора. После этого оценивать нужно уже не просто модель, а всю систему оркестрации.

Что почитать дальше