
OpenAI выпустила GPT-5.2-Codex — специализированную версию своей флагманской модели, ориентированную на автономную разработку программного обеспечения. Согласно официальному анонсу, это «самая продвинутая модель для кодинга» от компании, способная на долгосрочное планирование, масштабные трансформации кода и усиленную работу в области кибербезопасности. Релиз состоялся на фоне обострения конкуренции с Anthropic (Claude Opus 4.5) и Google (Gemini 3 Pro), которые в последние месяцы активно наращивали возможности своих агентных инструментов.
Что известно о GPT-5.2-Codex
GPT-5.2-Codex не является отдельной моделью в традиционном смысле — это продукт и рабочий слой, который оборачивает возможности GPT-5.2 с доступом к файловой системе, выполнению shell-команд, песочницам, процессам утверждения и ревью кода. Модель работает в нескольких поверхностях: CLI, расширения для IDE (VS Code, Cursor, Windsurf), настольное приложение для macOS/Windows и Codex Cloud для фоновых задач в GitHub-репозиториях.
Ключевое нововведение — «уплотнение ответов» (response compaction), механизм, который при превышении контекстного окна в 400 000 токенов выполняет сжатие состояния диалога с сохранением релевантной информации. В отличие от традиционной суммаризации, компакция сохраняет внутренний «ход мыслей» модели. Это позволяет агентам работать с большими кодовыми базами без потери контекста на протяжении длительных сессий.
OpenAI также добавила режим «xhigh thinking» — максимальный уровень аналитического усилия для сложных задач, доступный через API. В сочетании с адаптивным «thinking budget» модель автоматически распределяет вычислительные ресурсы в зависимости от сложности запроса.
Бенчмарки и позиционирование
OpenAI приводит следующие результаты GPT-5.2 на ключевых тестах:
— SWE-Bench Pro (реальные задачи разработки): 55,6%
— GPQA Diamond (научные рассуждения): 92,4%
— GDPval (профессиональные задачи по 44 специальностям): 70,9% побед или ничьих
Важно: эти цифры взяты из официальных материалов OpenAI. Независимые проверки показывают более сложную картину. Согласно обзору Turing College, GPT-5.2 «закрывает разрыв в большинстве областей до такой степени, что теперь это трехсторонняя гонка» между OpenAI, Anthropic и Google. При этом авторы отмечают, что прямое сравнение затруднено из-за разных уровней «thinking» внутри каждой модели.
На Reddit пользователи активно обсуждают сравнение Codex 5.2 с Claude Code. В одной из веток на r/ClaudeAI пользователь утверждает, что Codex 5.2 «лучше, чем Claude Code» в ряде сценариев, однако в треде на r/ClaudeCode, посвященном разработке на Rust, приводится «жесткая проверка реальностью»: модель показывает нестабильные результаты на сложных низкоуровневых задачах.
Практические выводы для разработчиков
Выбор между GPT-5.2-Codex и конкурентами упирается не в сырые бенчмарки, а в конкретные сценарии использования.
Что стоит учесть:
- Стоимость: GPT-5.5 (более новая флагманская модель, которая уже внедряется в Codex) стоит примерно в 2 раза дороже за токен по сравнению с GPT-5.4. Для команд, использующих Codex в CI/CD, это означает, что токен-потребление, а не количество запросов, становится основным драйвером бюджета.
- Контекстное окно: 400 000 токенов с компакцией — это серьезное преимущество для работы с монолитными репозиториями, где Claude Opus 4.5 (200K) упирается в лимиты. Однако на практике, как отмечают пользователи, точность модели может снижаться при приближении к границе окна, несмотря на компакцию.
- Безопасность: OpenAI позиционирует GPT-5.2-Codex как модель с усиленными возможностями кибербезопасности. Это предполагает улучшенную защиту от prompt injection и более строгие проверки при выполнении кода. Детали этих механизмов пока не раскрыты.
Ограничения и неопределенности
Важно понимать, что официальные бенчмарки — это контролируемые условия. Независимый тест GPT-5.2 на Terminal-Bench 2.0, согласно данным из обсуждений на Hacker News, показывает результат 77,3% (для версии 5.3 Codex). Однако, как отмечает один из участников обсуждения (представитель OpenAI Ted Sanders), производительность модели не зависит от времени суток или загрузки серверов, хотя пользователи сообщают о вариативности качества в течение дня.
Кроме того, модель уже не является самой новой: в апреле 2026 года OpenAI выпустила GPT-5.5, который становится новым флагманом и внедряется в Codex. GPT-5.5 показывает 74,0% на MRCR v2 при 1M токенов и 82,7% на Terminal-Bench 2.0, при этом уровень галлюцинаций снизился примерно на 60% по сравнению с предыдущими поколениями. Это означает, что GPT-5.2-Codex может быть промежуточным релизом, и командам, планирующим внедрение, стоит учитывать быстрый цикл обновлений.
Что делать командам
Для большинства команд, оценивающих Codex, практическая рекомендация остается прежней: начинать с CLI или IDE на небольших ограниченных задачах, прежде чем включать облачный режим; использовать Codex как pre-merge ревьювера в дополнение к генерации кода; разделять доступ администраторов и пользователей через workspace RBAC.
В условиях трехсторонней конкуренции — OpenAI Codex, Claude Code и Gemini Code Assist — выбор инструмента все чаще определяется не разовым бенчмарком, а совместимостью с существующим стеком, стоимостью токенов и стабильностью в долгих сессиях. GPT-5.2-Codex силен в долгосрочном планировании и работе с большими контекстами, но его преимущество может быть нивелировано быстрым выходом следующей версии.
