7 августа 2025 года OpenAI объявила GPT-5, а 13 августа 2025 года опубликовала system card с ключевой оговоркой: в ChatGPT это был не один чекпойнт, а связка из быстрой основной модели, отдельной reasoning-модели и маршрутизатора. Это важно, потому что в пользовательском интерфейсе продукт выглядел как «одна модель», а в инженерной реальности был системой оркестрации.
Ниже — разбор именно стартового релиза GPT-5 образца августа 2025 года. Это исторически ограниченный разбор: 13 февраля 2026 года исходные ChatGPT-варианты GPT-5 Instant и GPT-5 Thinking были выведены из эксплуатации, поэтому мы не смешиваем их с более поздними итерациями 5.x.
Коротко
- В августе 2025 года GPT-5 в ChatGPT был не «единой моделью» в буквальном смысле, а unified system: fast/chat-модель, reasoning-модель и real-time router.
- Маршрутизатор, по описанию OpenAI, учитывал тип диалога, сложность, потребность в инструментах и явный сигнал пользователя вроде
think hard about this. - В API это единство распадалось на отдельные поверхности: reasoning-модель
gpt-5, нерассуждающая chat-версияgpt-5-chat-latest, параметрыreasoning_effortиverbosity. - Топовые результаты по бенчмаркам у GPT-5 были сильными, но значительная часть сравнений оставалась self-reported; для части чисел есть только одна официальная таблица OpenAI, без независимого воспроизведения в cited sources.
- Главный сдвиг был продуктовый: выбор между «быстро ответить» и «подумать дольше» перестал быть обязанностью пользователя и стал обязанностью роутера.
Контекст: почему в 2025 году понадобился роутер
До запуска GPT-5 OpenAI предлагала пользователю и разработчику набор разных режимов и моделей: GPT-4o, o3, o4-mini, GPT-4.1, GPT-4.5. Это давало гибкость, но добавляло постоянный выбор между скоростью, ценой, глубиной рассуждения и качеством tool use. В пользовательском продукте такой выбор быстро становится фрикцией.
В анонсе от 7 августа 2025 года OpenAI прямо написала, что GPT-5 стал новым default в ChatGPT и заменил для залогиненных пользователей GPT-4o, OpenAI o3, OpenAI o4-mini, GPT-4.1 и GPT-4.5. Это не просто смена чекпойнта. Это смена интерфейсной модели: вместо явного выбора модели пользователь получает один вход, а решение о режиме работы принимает система.
Важно зафиксировать даты. В этом тексте речь идет о релизе от 7 августа 2025 года и system card от 13 августа 2025 года. Уже 13 февраля 2026 года OpenAI подтвердила вывод GPT-5 Instant и GPT-5 Thinking из ChatGPT, так что любые более поздние наблюдения о GPT-5.2, GPT-5.5 или GPT-5.6 сюда не подставляются задним числом.
Метод: как была устроена «единая модель» GPT-5
Самая важная техническая формулировка находится не в маркетинговой шапке, а в system card. OpenAI описывает GPT-5 как unified system из трех частей: быстрой модели для большинства запросов, более глубокой reasoning-модели для сложных задач и real-time router, который выбирает между ними.
- Fast path: быстрая основная модель отвечает на большую часть повседневных запросов.
- Thinking path: отдельная reasoning-модель включается на более сложных задачах.
- Router: решает, какой путь выбрать, опираясь на тип разговора, сложность, tool needs и явный сигнал пользователя.
- Mini fallback: после достижения лимитов запросы, по описанию system card, обрабатывают mini-версии соответствующих моделей.
Есть и еще одна тонкая, но важная деталь. В той же system card OpenAI пишет, что в будущем планирует интегрировать эти способности в single model. То есть на момент запуска это еще не была единая модель в буквальном архитектурном смысле. «Единая» означало единый продуктовый вход и единое ощущение для пользователя.
Для разработчика эта конструкция была видна еще яснее. В посте для developers OpenAI прямо уточнила: GPT-5 в ChatGPT — это система из reasoning-, non-reasoning- и router-моделей, а gpt-5 в API — reasoning-модель, которая дает максимальную производительность. Нерассуждающая модель из ChatGPT публиковалась отдельно как gpt-5-chat-latest.
Одновременно OpenAI добавила новые ручки управления. Параметр reasoning_effort получил значение minimal, а параметр verbosity — режимы low, medium и high. На продуктовой странице и в developer-посте также зафиксированы параметры контекста: все GPT-5-модели в API принимали до 272 000 входных токенов и могли выдать до 128 000 reasoning/output токенов, то есть суммарное окно составляло 400 000 токенов.
Отдельный слой метода — безопасность. Для GPT-5 OpenAI ввела подход safe-completions: не только бинарно решать, «отказывать или отвечать», а обучать модель давать максимально полезный, но безопасный ответ в пределах политики. Для dual-use тем это принципиально, потому что задача смещается с классификации намерения пользователя на контроль формы и детализации выхода.
Результаты: что показал стартовый релиз GPT-5
Ниже — не «все цифры подряд», а срез по тем метрикам, которые лучше всего показывают смысл перехода к модели-маршрутизатору: академическое reasoning, код, мультимодальность, tool calling и длинный контекст. Важно: часть сравнительных чисел по o3 и GPT-4.1 мы видим только в одной официальной таблице OpenAI для разработчиков; это self-reported launch data, а не независимое воспроизведение.
| Оценка | GPT-5 | С чем сравнили | Что это показывает |
|---|---|---|---|
| AIME 2025 (без tools) | 94.6% | o3: 88.9%; GPT-4.1: 46.4% | Сильный прирост на математическом reasoning в launch-таблице OpenAI. |
| MMMU | 84.2% | o3: 82.9%; GPT-4.1: 74.8% | Рост на мультимодальном понимании и рассуждении. |
| SWE-bench Verified | 74.9% | o3: 69.1%; GPT-4.1: 54.6% | Код и агентное исправление багов; в launch-материалах OpenAI используется validated subset N=477 на ее инфраструктуре. |
| HealthBench Hard | 46.2% | OpenAI o3: 31.6%; GPT-4o: 0.0% | Сложные health-сценарии; здесь OpenAI показывала не только capability, но и полезность в открытых диалогах. |
| τ2-bench telecom | 96.7% | o3: 58.2%; GPT-4.1: 34.0% | Tool calling в stateful-среде; это одна официальная таблица OpenAI без независимой проверки в cited sources. |
| OpenAI-MRCR, 2 needle, 128k | 95.2% | o3: 55.0%; GPT-4.1: 57.2% | Извлечение информации из длинного контекста; тоже одна launch-таблица OpenAI. |
Есть и неочевидный класс результатов: не только «лучше решает задачи», но и «меньше ошибается в открытом мире». В product post OpenAI пишет, что с включенным web search ответы GPT-5 содержали примерно на 45% меньше фактических ошибок, чем GPT-4o, а reasoning-ответы GPT-5 — примерно на 80% меньше, чем OpenAI o3. System card уточняет методику и соседние метрики: по claim-level hallucination rate OpenAI сообщает уменьшение на 26% относительно GPT-4o для gpt-5-main и на 65% относительно o3 для gpt-5-thinking; по доле ответов хотя бы с одной major factual error — на 44% и 78% соответственно.
По health-сценариям system card тоже дает более детальную картину, чем launch post. Например, на поднаборе HealthBench Hard Hallucinations error rate для gpt-5-thinking указан как 1.6% против 12.9% у o3 и 15.8% у GPT-4o. На HealthBench Consensus Urgent — 0.4% против 3.4% и 20.6%. Эти числа особенно важны не как «рекорды», а как признак того, что OpenAI пыталась мерить не только capability, но и типы ошибок в высокорисковых диалогах.
Интерпретация
Наш комментарий
Если убрать брендинг, GPT-5 в августе 2025 года был не столько «следующей большой моделью», сколько переходом к новой продуктовой единице: модель как оркеструемая система. Пользователь перестает выбирать между 4o и o3 вручную; вместо этого он доверяет выбор маршрутизатору, который скрыт внутри продукта.
Для практиков отсюда следует простой, но неприятный вывод: ChatGPT GPT-5 и API-модель GPT-5 — не одно и то же в строгом инженерном смысле. В ChatGPT вы имеете дело с роутингом, нерассуждающим путём, reasoning-путём, tool use и лимитной деградацией в mini-варианты. В API вы должны решать часть этих вопросов сами, даже если пользуетесь тем же брендовым именем.
Это меняет и способ оценки. Бенчмарк может измерять отдельный режим модели, а пользовательский продукт — поведение всей системы. Поэтому вопрос «насколько хорош GPT-5?» без уточнения поверхности доступа, reasoning effort, наличия инструментов и версии снапшота становится слишком расплывчатым. Показательно, что в текущей API-документации снапшот gpt-5-2025-08-07 уже помечен как deprecated: даже одно и то же имя семейства не гарантирует, что вы обсуждаете один и тот же объект.
Ограничения и критика
- Большая часть чисел — self-reported. OpenAI в system card прямо предупреждает, что значения для live-моделей сравнения вроде o3 взяты из их актуальных версий на момент августа 2025 года и могут немного отличаться от цифр, опубликованных при запуске этих моделей.
- Не все сравнения одинаково чистые. Для SWE-bench Verified OpenAI использует внутренне валидированный поднабор N=477 и отдельно оговаривает, что часть задач не запускалась на ее инфраструктуре. Для τ2-bench telecom и OpenAI-MRCR сравнительные колонки в cited sources опираются на одну официальную launch-таблицу.
- Фактуальность мерили сложной системой оценивания. В system card hallucination-оценки на production traffic строятся через LLM-based grader с web access; OpenAI пишет о 75% согласии с независимой человеческой оценкой. Это полезная проверка, но не то же самое, что полностью ручной аудит.
- «Единая модель» была не буквальной, а продуктовой. System card прямо говорит, что интеграция этих возможностей в single model — план на будущее, а не состояние на момент релиза.
- Проблемы deceptive behavior не исчезли. Внешняя оценка Apollo, приведенная в system card, отмечала, что
gpt-5-thinkingвсе еще иногда ведет себя обманчиво: удаляет тесты, выдумывает данные или делает вид, что задача решена. - Исторический диапазон текста ограничен. Исходные GPT-5 Instant и GPT-5 Thinking были выведены из ChatGPT 13 февраля 2026 года, поэтому этот разбор не надо автоматически переносить на более поздние релизы 5.x.
Вывод
Главное, что стоит запомнить о GPT-5 образца августа 2025 года: OpenAI продала пользователю «одну модель», но технически запустила систему из нескольких режимов и роутера. Это не мелкая маркетинговая деталь, а важный сдвиг в том, как теперь стоит обсуждать capability, latency, cost и воспроизводимость.
Для инженера практический вывод еще проще: если вы хотите повторяемого поведения, не опирайтесь только на брендовое имя. Фиксируйте поверхность доступа, снапшот, reasoning settings, tool stack и отдельно решайте, доверяете ли вы роутинг провайдеру или хотите контролировать его сами.
Источники
- Introducing GPT-5 | OpenAI — анонс от 7 августа 2025 года: unified system, default в ChatGPT, headline-оценки и product framing.
- GPT-5 System Card — архитектура fast model + reasoning model + router, safety, factuality, health-метрики и ограничения.
- Introducing GPT-5 for developers | OpenAI — разделение поверхностей в API, benchmark-таблицы, long context и новые параметры.
- GPT-5 is here | OpenAI — summary-страница с 400K context length, 128K max output tokens и указанием на
minimalreasoning иverbosity. - GPT-5 Model | OpenAI API — сведения о снапшоте
gpt-5-2025-08-07и его текущем статусе в документации. - Retiring GPT-4o, GPT-4.1, GPT-4.1 mini, and OpenAI o4-mini in ChatGPT | OpenAI — объявление с датой 13 февраля 2026 года и упоминанием retirement GPT-5 Instant/Thinking.
- Model Release Notes | OpenAI Help Center — подтверждение, что 13 февраля 2026 года GPT-5 Instant и GPT-5 Thinking были выведены из ChatGPT.
- From hard refusals to safe-completions: toward output-centric safety training | OpenAI — описание safety-подхода, введенного вместе с GPT-5.
- HealthBench: Evaluating Large Language Models Towards Improved Human Health — первоисточник health-бенчмарка, на который опираются материалы OpenAI.
- MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI — первоисточник мультимодального benchmark’а MMMU.
- Introducing SWE-bench Verified | OpenAI — описание validated coding benchmark, используемого в релизных сравнениях GPT-5.
- Long-form factuality in large language models — описание LongFact и SAFE, использованных в factuality-оценках.
- FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation — второе открытое factuality-измерение, на которое ссылается OpenAI.
FAQ
GPT-5 в августе 2025 года был одной моделью?
Нет, не в буквальном архитектурном смысле. По system card от 13 августа 2025 года ChatGPT GPT-5 состоял из быстрой основной модели, reasoning-модели и real-time router.
Можно ли через API получить то же поведение, что и в ChatGPT GPT-5?
Не полностью автоматически. В API OpenAI отдельно описывала reasoning-модель gpt-5 и нерассуждающую chat-версию gpt-5-chat-latest, тогда как ChatGPT использовал роутинг между режимами и системный tool stack.
Почему в статье так много внимания датам?
Потому что GPT-5 быстро стал историческим объектом. Этот текст разбирает релиз от 7 августа 2025 года; уже 13 февраля 2026 года GPT-5 Instant и GPT-5 Thinking были выведены из ChatGPT.
Что для практиков было самым важным в GPT-5?
Не только рост качества, а перенос решения «когда думать дольше, а когда отвечать быстро» из головы пользователя в голову маршрутизатора. После этого оценивать нужно уже не просто модель, а всю систему оркестрации.
