Запись архива

GPT-5.4 Mini High: профиль модели OpenAI в рейтинге COMRAD404

GPT-5.4 Mini High — компактная рассуждающая модель OpenAI с сильным пользовательским предпочтением и контекстом 400 тысяч токенов. Разбираем её место в рейтинге, цену, сценарии, ограничения и проверку на реальных задачах.

GPT-5.4 Mini High от OpenAI — профиль модели, метрики COMRAD404 и сценарии применения

GPT-5.4 Mini High — модель для тех случаев, когда важнее стабильный пользовательский результат и большой контекст, чем максимальный балл в кодинге. В редакционном срезе COMRAD404 от 31 августа 2026 года она занимает 75-е место с COMRAD Score 62,0. Профиль неоднородный: суббалл человеческого предпочтения очень высокий — 92,5, а оценки качества и кодинга заметно скромнее — 50,0 и 45,5 соответственно.

Это не означает, что модель отвечает правильно в 92,5% случаев. COMRAD Score и пять суббаллов — нормализованные редакционные оценки по шкале от 0 до 100. LMArena rating — статистический рейтинг слепых попарных сравнений, а не процент правильных ответов. Поэтому GPT-5.4 Mini High разумно рассматривать как модель с хорошей воспринимаемой полезностью в диалоге, но без оснований считать её универсальным лидером для сложного программирования или высокорисковых задач.

Коротко

  • Разработчик: OpenAI.
  • Статус: production-модель, не preview; в паспорте указана как GPT-5.4 Mini High.
  • Тип доступа: проприетарная модель, open weights отсутствуют.
  • Рассуждение: поддерживается; обозначение High относится к режиму усилия рассуждения, а не к отдельной архитектуре.
  • Контекст: 400 000 токенов.
  • Цена в паспорте: 0,75 доллара за 1 млн входных токенов и 4,50 доллара за 1 млн выходных.
  • Скорость: точные значения output tokens per second и time to first token в срезе отсутствуют.
  • Главный плюс: высокий показатель human preference — 92,5.
  • Главный риск выбора: средние редакционные оценки качества, эффективности и доступа при более слабом кодовом профиле.

Официально OpenAI позиционирует GPT-5.4 Mini как модель для высоконагруженных сценариев, программирования, компьютерного использования, мультимодальной обработки и субагентов. Эти заявления разработчика не заменяют независимую проверку на конкретном наборе задач.

Место в рейтинге

В редакции COMRAD404 GPT-5.4 Mini High находится на 75-м месте общего рейтинга 2026 H2. COMRAD Score равен 62,0 из 100. Итоговая оценка сформирована из пяти суббаллов с разными весами: качество — 40%, человеческое предпочтение — 30%, кодинг — 15%, эффективность — 10%, доступ — 5%.

Такое распределение объясняет, почему высокий human preference не превращается автоматически в высокий общий результат. Показатель качества 50,0 имеет самый большой вес, а кодинг 45,5 дополнительно ограничивает итог. С другой стороны, значение 92,5 по пользовательскому предпочтению заметно поддерживает общий балл: модель, вероятно, часто выглядит убедительно, понятно формулирует ответы и хорошо воспринимается в интерактивном использовании.

На текстовой LMArena модель имеет rating 1448,3, занимает 70-е место и представлена в сравнении на основании 59 472 голосов. В Code Arena её rating составляет 1397,1, место — 71-е. Эти числа нужно читать как результаты парных сравнений, зависящие от состава соперников, пользовательских запросов и периода измерения. Они не являются процентами точности и не описывают все стороны API.

Artificial Analysis Intelligence Index для данной модели в паспорте отсутствует. Восстанавливать его по другим рейтингам или по официальным тестам OpenAI нельзя: это была бы подмена одной метрики другой.

Полный контекст позиции и методику чтения показателей можно посмотреть в рейтинге COMRAD404. Для выбора модели полезнее изучать не только место в списке, но и форму профиля: у GPT-5.4 Mini High она заметно смещена в сторону диалогового предпочтения и практичной универсальности.

Паспорт модели

Параметр Значение в срезе
Название GPT-5.4 Mini High
Канонический идентификатор gpt-5-4-mini
Организация OpenAI
Лицензия Proprietary
Open weights Нет
Рассуждение Да
Preview Нет
COMRAD Score 62,0 / 100
Место COMRAD404 75
Контекст 400 000 токенов
Input price $0,75 / 1 млн токенов
Output price $4,50 / 1 млн токенов
Output tokens per second Данных нет
Time to first token Данных нет
Artificial Analysis Index Данных нет

Канонический slug в паспорте — gpt-5-4-mini, а официальная документация OpenAI использует название GPT-5.4 Mini и показывает алиас gpt-5.4-mini с датированной версией gpt-5.4-mini-2026-03-17. В статье эти обозначения не следует смешивать: профиль COMRAD404 относится именно к записи GPT-5.4 Mini High.

Разбор пяти суббаллов

Суббалл Оценка Вес Что это значит при выборе
Качество 50,0 / 100 40% Средний базовый уровень в редакционной нормализации; нужна проверка точности и полноты на доменных задачах.
Human preference 92,5 / 100 30% Сильное восприятие ответов людьми в интерактивных сравнениях; полезно для ассистентов и диалоговых интерфейсов.
Coding 45,5 / 100 15% Кодовый профиль не является главным аргументом; сложные изменения требуют тестов и ревью.
Efficiency 51,6 / 100 10% Редакционная оценка не даёт оснований обещать конкретную задержку или throughput.
Access 45,0 / 100 5% Доступ и условия использования заметно зависят от API-провайдера, тарифа и режима.

Суббаллы нельзя трактовать как независимые тестовые проценты. Это редакционная нормализация, предназначенная для сопоставления моделей внутри методики COMRAD404. В практическом проекте итог стоит дополнять собственными измерениями: одна и та же модель может хорошо выглядеть в чате и хуже — в JSON-пайплайне с жёсткими требованиями к схеме.

Что подтверждает OpenAI

В официальном анонсе от 17 марта 2026 года OpenAI описывает GPT-5.4 Mini как более быстрый и эффективный вариант для больших объёмов работы. Среди заявленных направлений — coding, subagents, computer use, tool use и мультимодальные задачи с изображениями. В документации также указаны reasoning effort от none до xhigh, структурированные ответы, function calling, streaming и набор инструментов Responses API.

Официальная документация подтверждает окно контекста 400 000 токенов и максимальный объём вывода 128 000 токенов. Там же перечислены поддерживаемые текстовые и входные графические данные; аудио и видео для этой модели не заявлены как поддерживаемые модальности. Это важное ограничение для систем, которые рассчитывают на единую модель для всех типов медиа.

OpenAI приводит собственные результаты на SWE-Bench Pro, Terminal-Bench, Toolathlon, GPQA Diamond и OSWorld-Verified. Это официальные заявления и измерения разработчика, выполненные в описанных им условиях. Они полезны для понимания целевого профиля, но не должны смешиваться с LMArena и COMRAD404: у этих источников разные задачи, шкалы и методики.

В найденных официальных материалах нет подтверждения размера модели, числа параметров или детального описания архитектуры GPT-5.4 Mini. Поэтому такие сведения в профиль не включаются. Также нельзя переносить характеристики системной карты GPT-5.4 Thinking на Mini без прямого указания, что конкретный результат относится к GPT-5.4 Mini.

Возможности и сценарии

Диалоговые ассистенты

Высокий human preference делает модель кандидатом для пользовательских чатов, справочных интерфейсов, внутренних помощников и систем, где важны ясность, уместный тон и способность продолжать многошаговый диалог. Однако хорошая воспринимаемость не гарантирует фактическую корректность. Для справочных и корпоративных сценариев понадобятся поиск по источникам, цитирование, маршрутизация сложных запросов и проверка опасных утверждений.

Работа с длинным контекстом

Окно 400 000 токенов подходит для анализа крупных документов, нескольких связанных файлов, длинной переписки или репозитория. На практике длинный контекст не означает одинаково высокую точность на любой позиции. При тестировании нужно проверять поиск фактов в начале, середине и конце входа, а также устойчивость к повторяющимся и конфликтующим инструкциям.

Субагенты и оркестрация

Модель может использоваться как исполнитель узкой подзадачи: извлечь сведения из документов, найти релевантные фрагменты, подготовить черновой патч, классифицировать результат или проверить формат. Для оркестратора важно ограничивать область ответственности субагента и передавать итог на валидацию. Низкая цена входа особенно полезна там, где один пользовательский запрос запускает много вспомогательных вызовов.

Инструменты и компьютерное использование

Официальная документация перечисляет function calling, structured outputs, web search, file search, code interpreter, computer use, MCP и другие инструменты в Responses API. Это расширяет область применения за пределы обычной генерации текста. Но фактический результат зависит от схем инструментов, качества описаний функций, разрешений и обработки ошибок. Модель не должна самостоятельно получать полномочия, которые не нужны для конкретной операции.

Программирование

OpenAI продвигает GPT-5.4 Mini для кодинга, а в независимом паспорте модель получила Code Arena rating 1397,1 и 71-е место. При этом coding subscore COMRAD404 равен 45,5. Практический вывод сдержанный: модель подходит для навигации по коду, небольших исправлений, генерации тестов, объяснения ошибок и вспомогательных этапов, но для критичных изменений нужны компиляция, автоматические тесты, анализ зависимостей и человеческое ревью.

Цена и скорость

В паспорте указаны $0,75 за 1 млн входных токенов и $4,50 за 1 млн выходных токенов. Это разные единицы тарификации, поэтому сравнивать их как одну цену некорректно. При условном запросе с 1 млн входных и 100 тысячами выходных токенов стоимость составит около $1,20 до учёта кэширования, специальных инструментов, региональной обработки, налогов и условий конкретного провайдера.

Официальная страница OpenAI подтверждает те же базовые ставки и отдельно указывает цену кэшированного входа $0,075 за 1 млн токенов. В паспорте COMRAD404 кэшированная ставка не включена в raw metrics, поэтому она не используется для расчёта COMRAD Score. Стоимость может меняться, а разные режимы API и посредники могут применять собственные условия.

Числа output tokens per second и time to first token в зафиксированном срезе отсутствуют. Нельзя превращать официальное описание модели как «быстрой» или «более чем вдвое быстрой» в конкретный SLA. Для продукта важны задержка сети, очередь провайдера, длина входа, объём рассуждений, инструменты и параллельность запросов. Их нужно измерять в своей инфраструктуре.

Ограничения

  • Закрытая лицензия. Open weights отсутствуют, поэтому модель нельзя локально развернуть или независимо модифицировать как открытую весовую модель.
  • Зависимость от поставщика. Доступ, лимиты, цена, региональная обработка и поведение алиаса контролируются платформой и могут измениться.
  • Нет полной картины по независимым метрикам. Artificial Analysis Intelligence Index в срезе не представлен, а данные по скорости отсутствуют.
  • Средний кодовый профиль. Рейтинги LMArena Code и coding subscore не поддерживают выбор модели как безусловного инструмента для сложной разработки.
  • Рассуждение не равно достоверности. Наличие reasoning помогает тратить вычисления на многошаговые задачи, но не устраняет галлюцинации, ошибки в предпосылках и неверное использование инструментов.
  • Мультимодальность ограничена. Официальная документация указывает изображения как входную модальность, но не заявляет поддержку аудио и видео.
  • Длинный контекст требует контроля. На больших входах растут стоимость, время обработки и риск пропустить важную инструкцию или факт.

Для юридических, медицинских, финансовых, кадровых и иных чувствительных сценариев модель следует использовать только внутри контура с проверяемыми источниками, журналированием, ограничением доступа и процедурой эскалации к человеку.

Как проверить на своей задаче

  1. Соберите репрезентативную выборку. Возьмите реальные запросы пользователей, а не только демонстрационные примеры. Разделите их на обычные, сложные, конфликтные и ошибочные.
  2. Зафиксируйте версию. Если API позволяет, тестируйте датированный snapshot, а не только плавающий алиас. Запишите reasoning effort, системные инструкции, инструменты и параметры генерации.
  3. Определите критерии до запуска. Для текста это полнота, фактическая точность и тон; для JSON — соответствие схеме; для кода — прохождение тестов, отсутствие регрессий и качество diff.
  4. Проверьте длинный контекст. Разместите контрольные факты на разных позициях, добавьте отвлекающие данные и измерьте точность извлечения. Отдельно посчитайте стоимость входа и выхода.
  5. Измерьте задержку. Соберите p50, p95 и p99 для time to first token и полного ответа при нескольких длинах входа. Не заменяйте эти измерения средним значением из чужого обзора.
  6. Проверьте инструменты. Подайте неоднозначные запросы, недоступный инструмент, ошибочный аргумент и конфликт между текстом и схемой. Хорошая модель должна корректно отказываться и возвращать контролируемую ошибку.
  7. Сравните режимы рассуждения. Измерьте, что даёт High по точности и сколько добавляет к стоимости и задержке. Более интенсивный режим не всегда оправдан для простого извлечения или классификации.
  8. Проведите слепую оценку. Скрывайте название модели у проверяющих, перемешивайте ответы и оценивайте не только впечатление, но и объективные критерии. Это поможет понять, действительно ли высокий human preference совпадает с ценностью для вашей команды.

Минимальный пилот — 100–300 запросов на каждый ключевой сценарий, несколько повторов для нестабильных задач и обязательная ручная проверка ошибок. После этого можно решить, использовать ли GPT-5.4 Mini High как основную модель, маршрутизировать на неё только часть запросов или оставить для субагентных операций.

Итоговая оценка

GPT-5.4 Mini High — не универсальная «модель на все случаи», а сбалансированный проприетарный инструмент с особенно сильным пользовательским восприятием, большим контекстом и официально заявленной поддержкой инструментов. Её место в рейтинге — результат компромисса: высокий human preference заметно контрастирует со средними quality и efficiency и с более слабым coding-профилем.

Выбор в её пользу оправдан, если продукту нужны диалоговый интерфейс, длинные документы, structured outputs, вызов инструментов и большое число относительно недорогих обращений. Если основной критерий — автономная разработка сложного кода, минимальная задержка с подтверждёнными цифрами или локальное развёртывание, паспорт не даёт достаточных оснований считать эту модель оптимальной. В этих случаях решение следует принимать только после собственного тестирования и расчёта полной стоимости владения.

FAQ

Что означает GPT-5.4 Mini High?

В паспорте это название профиля модели GPT-5.4 Mini с включённым высоким уровнем усилия рассуждения. High не означает процент качества и не описывает размер модели.

Какое место занимает модель?

В срезе COMRAD404 2026 H2 от 31 августа 2026 года GPT-5.4 Mini High занимает 75-е место с COMRAD Score 62,0 из 100.

Подходит ли модель для программирования?

Да, OpenAI заявляет кодинг одним из целевых сценариев, а модель поддерживает связанные инструменты. Но coding subscore COMRAD404 равен 45,5, а Code Arena rating — 1397,1 при 71-м месте, поэтому сложный код нужно проверять тестами и ревью.

Сколько стоит GPT-5.4 Mini High?

В паспорте указано $0,75 за 1 млн входных токенов и $4,50 за 1 млн выходных. Условия зависят от API-провайдера и режима; цена не является неизменной гарантией.

Какая у модели скорость ответа?

Точные значения output tokens per second и time to first token отсутствуют в срезе. Скорость нужно замерять в собственной связке API, сети, инструментов и параметров рассуждения.

Есть ли у модели открытые веса?

Нет. В паспорте указаны proprietary license и open_weights false. Это закрытая модель, а не открытое программное обеспечение и не пакет весов для локального запуска.

Какой контекст поддерживает модель?

В паспорте указан контекст 400 000 токенов. Официальная документация также указывает максимальный вывод до 128 000 токенов. Реальная полезность длинного контекста зависит от задачи и качества входных данных.

Источники

Профиль составлен по паспорту модели COMRAD404 и независимым рейтингам, зафиксированным в срезе 31 августа 2026 года. Официальные материалы OpenAI использованы для проверки названия, возможностей, цены, контекста, доступных режимов и даты публикации. Заявления разработчика не смешиваются с редакционными оценками и рейтингами слепых сравнений.