GPT-5.4 Nano High стоит выбирать не как универсальную замену крупной reasoning-модели, а как недорогой исполнитель для массовых структурированных операций. Её сильная сторона — сочетание цены, контекста на 400 000 токенов, поддержки рассуждений и заметной пользовательской оценки. Главный риск — неполная измеримость: в срезе нет Artificial Analysis Intelligence Index, отдельного LMArena Code rating и независимых данных о скорости.
Коротко
- Позиция: 80-е место в редакции рейтинга COMRAD404 2026 H2.
- COMRAD Score: 61,7 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
- Лучшие стороны профиля: human preference — 79,8; efficiency — 79,6.
- Слабые стороны профиля: access — 45,0; quality и coding — по 50,0 при неполном покрытии независимыми метриками.
- Цена в срезе: $0,20 за миллион входных и $1,25 за миллион выходных токенов.
- Контекст: 400 000 токенов.
- Подходящие задачи: классификация, извлечение данных, ранжирование, маршрутизация запросов, вспомогательные агенты и ограниченные операции с кодом.
- Уровень уверенности: ограниченный из-за пробелов в независимых измерениях.
Паспорт модели
| Параметр | Значение на 31 августа 2026 года |
|---|---|
| Модель | GPT-5.4 Nano High |
| Разработчик | OpenAI |
| Статус | Стабильная API-модель, не preview |
| Лицензия | Проприетарная |
| Открытые веса | Нет |
| Reasoning | Да; профиль High |
| COMRAD Score | 61,7 из 100 |
| Место | 80 |
| LMArena Text | 1402,2; 141-е место; 58 539 голосов |
| Artificial Analysis Intelligence Index | Данных в срезе нет |
| LMArena Code | Данных в срезе нет |
| Цена входа | $0,20 за 1 млн токенов |
| Цена выхода | $1,25 за 1 млн токенов |
| Скорость генерации | Данных в срезе нет |
| Time to first token | Данных в срезе нет |
| Контекст | 400 000 токенов |
Название High в этом профиле обозначает конфигурацию модели с повышенным уровнем рассуждений. В API базовый идентификатор — gpt-5.4-nano, а режим задаётся параметром reasoning.effort: "high". Это не отдельная архитектура и не самостоятельная открытая модель.
Место в рейтинге
GPT-5.4 Nano High занимает 80-е место в рейтинге моделей ИИ COMRAD404 редакции 2026 H2, рассчитанном по методологии 1.0. Позиция отражает компромисс: модель получает высокие редакционные баллы за пользовательское восприятие и эффективность, но не располагает полным набором независимых измерений, необходимым для уверенной оценки качества, программирования и задержки.
COMRAD Score 61,7 складывается из пяти нормализованных суббаллов с разными весами. Quality даёт 40% итоговой оценки, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. Взвешенный результат до округления равен 61,65. Эти значения нельзя читать как вероятность правильного ответа или долю успешно выполненных задач.
Отдельно важно не смешивать место COMRAD404 и 141-е место в LMArena Text. Это разные рейтинги с разной методикой. COMRAD404 объединяет несколько аспектов модели, тогда как LMArena строится на слепых попарных пользовательских сравнениях. Rating 1402,2 также не означает 1402 правильных ответа или какой-либо процент качества.
Разбор пяти суббаллов
| Суббалл | Оценка | Вес | Практическое прочтение |
|---|---|---|---|
| Quality | 50,0 | 40% | Средняя редакционная позиция при отсутствии Intelligence Index в зафиксированном срезе. |
| Human preference | 79,8 | 30% | Сильная сторона: модель получила значительный массив слепых сравнений в текстовой арене. |
| Coding | 50,0 | 15% | Нейтральная оценка; отдельного LMArena Code rating нет, поэтому превосходство в программировании не подтверждено. |
| Efficiency | 79,6 | 10% | Выгодный экономический профиль и большой контекст, но без независимой скорости в токенах в секунду. |
| Access | 45,0 | 5% | Доступ через проприетарный API; веса модели не опубликованы. |
Наиболее убедительный сигнал — human preference 79,8. Он опирается на LMArena Text rating 1402,2 и 58 539 голосов. Такой объём сравнений делает результат содержательнее единичного лабораторного теста, но арена всё равно измеряет предпочтение пользователей, а не фактическую точность, безопасность или соблюдение бизнес-правил.
Quality и coding по 50,0 следует трактовать осторожно. В паспорте отсутствуют Artificial Analysis Intelligence Index и кодовый рейтинг LMArena. Поэтому эти суббаллы не доказывают среднюю способность модели в буквальном смысле: они обозначают редакционную позицию при ограниченном покрытии источниками.
Возможности и сценарии
Официальная позиция OpenAI: GPT-5.4 nano предназначена для задач, где особенно важны стоимость и масштаб обработки. Разработчик указывает классификацию, извлечение данных, ранжирование и работу вспомогательных агентов как основные сценарии. Документация также подтверждает поддержку текстового и графического ввода, текстового вывода, function calling и structured outputs.
Редакционная интерпретация: модель имеет смысл ставить в те участки конвейера, где запрос можно формализовать, результат автоматически проверить, а ошибка не приводит напрямую к необратимому действию. Типовые варианты:
- распределение обращений по очередям и категориям;
- извлечение реквизитов, дат, сущностей и статусов из документов;
- преобразование текста в JSON по фиксированной схеме;
- предварительное ранжирование результатов поиска;
- проверка формата и полноты карточек товаров;
- суммаризация больших пакетов однотипных материалов;
- поиск файлов и фрагментов кода вспомогательным субагентом;
- черновые точечные правки с обязательным запуском тестов;
- маршрутизация сложных запросов к более мощной модели.
Официальная документация указывает поддержку web search, file search, code interpreter, hosted shell, apply patch, MCP и генерации изображений через Responses API. При этом computer use для GPT-5.4 nano не поддерживается. Наличие инструмента не гарантирует, что модель будет безошибочно выбирать момент вызова или правильно интерпретировать результат: эти свойства нужно проверять отдельно.
Режим High и интеграция
GPT-5.4 nano поддерживает уровни reasoning effort от none до xhigh. Рассматриваемый профиль использует high. Повышенный effort может помочь в многошаговой классификации, выборе инструментов и задачах с зависимыми ограничениями, но способен увеличить число рассуждающих и выходных токенов, стоимость и задержку.
{
"model": "gpt-5.4-nano",
"reasoning": {"effort": "high"},
"input": "Проверь документ по правилам и верни JSON"
}
Не стоит устанавливать High для всех запросов по умолчанию. Для простого определения языка, извлечения одного поля или выбора категории полезно сравнить none, low, medium и high. Победителем должен стать режим с лучшим результатом на вашем наборе данных при приемлемой стоимости и задержке, а не конфигурация с максимальным объёмом рассуждений.
Цена и скорость
В паспорте зафиксирована цена $0,20 за миллион входных и $1,25 за миллион выходных токенов. Например, 10 млн входных и 1 млн выходных токенов по этим ставкам обойдутся в $3,25. Нагрузка из 100 млн входных и 10 млн выходных токенов — в $32,50. Это расчёт токенной части без стоимости инструментов, хранения, поиска, инфраструктуры, повторных запросов и контроля качества.
Цена особенно привлекательна для конвейеров с коротким структурированным ответом. Если модель получает длинный документ, но возвращает несколько полей JSON, выходная часть счёта остаётся ограниченной. Для разговорного интерфейса с многословными ответами разница между входной и выходной ставкой становится заметнее.
Цены зависят от API-провайдера, режима обработки и дополнительных функций и могут измениться после даты среза. Их нельзя использовать как бессрочное коммерческое предложение. Перед запуском следует сверять действующий прайс и считать реальное потребление, включая reasoning-токены и повторные попытки.
Независимых значений output tokens per second и time to first token в паспорте нет. Поэтому высокий efficiency 79,6 не следует переводить в обещание мгновенного ответа. Задержка зависит от reasoning effort, длины контекста, нагрузки провайдера, региона, инструментов и объёма вывода.
Контекст и длинные документы
Контекст на 400 000 токенов позволяет передавать крупные наборы документов, длинные инструкции и значительную часть репозитория. Но размер окна — это технический предел ввода, а не гарантия одинакового внимания к каждому фрагменту. Чем больше материал, тем важнее проверять поиск редких фактов, соблюдение дальних зависимостей и устойчивость к противоречащим инструкциям внутри документов.
Для практического применения длинного контекста лучше заранее размечать источники, нумеровать документы и требовать ссылки на идентификаторы фрагментов. Если задача допускает retrieval, часто выгоднее сначала выбрать релевантные части, а затем передать их модели. Это уменьшает стоимость и упрощает аудит ответа.
В паспорте отсутствует отдельная независимая оценка качества длинного контекста. Поэтому 400 000 токенов говорят о вместимости запроса, но не подтверждают точность извлечения на всём диапазоне окна.
Ограничения
- Неполное покрытие бенчмарками. В срезе нет Artificial Analysis Intelligence Index и LMArena Code rating.
- Нет независимой скорости. Значения токенов в секунду и времени до первого токена отсутствуют.
- Проприетарность. Веса закрыты, локальное развёртывание и независимый аудит параметров недоступны.
- High не гарантирует лучший результат. Дополнительное рассуждение может повышать стоимость и задержку без измеримого выигрыша.
- Рейтинг предпочтений не равен точности. LMArena отражает выбор участников в слепых парах, а не прохождение ваших бизнес-проверок.
- Кодинг подтверждён ограниченно. Модель можно тестировать как вспомогательного кодового агента, но паспорт не содержит отдельного кодового рейтинга.
- Длинный контекст не равен идеальной памяти. Важные факты могут теряться среди нерелевантного текста.
- Нет открытых весов. GPT-5.4 Nano High нельзя называть открытым ПО или open-weight моделью.
В найденных официальных материалах не указаны размер модели в параметрах и подробная архитектура GPT-5.4 nano. Отдельная model card именно для nano также не была обнаружена: опубликованный OpenAI материал по безопасности GPT-5.4 содержит приложение о mini, но не даёт сопоставимого самостоятельного профиля nano. Восстанавливать эти сведения по аналогии с другими версиями нельзя.
Как проверить на своей задаче
- Соберите закрытый набор. Возьмите не менее нескольких десятков реальных примеров, включая редкие, неоднозначные и ошибочно оформленные входы.
- Определите проверяемый результат. Для классификации используйте accuracy или F1, для извлечения — точное совпадение полей, для кода — тесты и статический анализ.
- Зафиксируйте API-версию. Для воспроизводимости используйте доступный snapshot, а не только плавающий alias.
- Сравните effort. Прогоните одинаковые примеры на
none,low,mediumиhigh. - Измерьте задержку. Записывайте медиану, p95, время до первого токена и полную длительность с учётом инструментов.
- Считайте стоимость успешной операции. Учитывайте не один запрос, а повторы, исправления JSON, reasoning-токены и эскалации.
- Проверьте устойчивость. Меняйте порядок документов, добавляйте нерелевантный текст и перефразируйте инструкции.
- Разделите риск. Для платежей, публикации, удаления данных и юридически значимых решений оставьте детерминированную проверку или подтверждение человеком.
Главная метрика для выбора — не цена миллиона токенов, а стоимость одного принятого результата. Дешёвая модель перестаёт быть дешёвой, если требует много повторов или создаёт ошибки, которые приходится исправлять вручную.
Кому подходит
GPT-5.4 Nano High подходит командам, у которых есть большой поток однотипных запросов, строгая схема результата и автоматическая проверка. Особенно логична роль первого уровня: модель извлекает, классифицирует и ранжирует, а сложные или неуверенные случаи передаёт более сильному обработчику либо человеку.
Модель менее убедительна как единственный исполнитель открытых исследовательских задач, критичных изменений кода и решений, где нужна доказанная независимыми тестами точность. Для таких сценариев паспорт оставляет слишком много неизвестных: нет Intelligence Index, кодового рейтинга и измеренной скорости.
FAQ
Что означает High в названии GPT-5.4 Nano High?
Это профиль запуска GPT-5.4 nano с параметром reasoning.effort: "high", а не отдельный API slug или другая архитектура.
Является ли COMRAD Score 61,7 процентом качества?
Нет. Это нормализованная редакционная оценка по шкале от 0 до 100, собранная из пяти суббаллов с разными весами.
Что означает LMArena rating 1402,2?
Это статистический рейтинг, рассчитанный по слепым попарным сравнениям ответов. Он не является процентом правильных ответов. В срезе учтено 58 539 голосов.
Насколько быстро работает модель?
В паспорте нет данных о токенах в секунду и времени до первого токена. Скорость нужно измерять у выбранного API-провайдера на собственных запросах и в нужном reasoning-режиме.
Подходит ли GPT-5.4 Nano High для программирования?
Её можно применять для точечных правок, навигации по коду и вспомогательных субагентов, но отдельный LMArena Code rating отсутствует. Качество следует подтверждать тестами репозитория.
Можно ли развернуть модель локально?
Нет доступных открытых весов. Модель проприетарная и предоставляется через API.
Гарантирует ли контекст 400 000 токенов точную работу со всем документом?
Нет. Контекст обозначает доступную вместимость, но не гарантирует одинаковое внимание, поиск всех деталей или устойчивость к помехам.
Источники
- OpenAI: Introducing GPT-5.4 mini and nano — официальный анонс, дата выпуска, позиционирование, доступность и цена GPT-5.4 nano.
- OpenAI API: GPT-5.4 nano Model — идентификатор модели, reasoning effort, контекст, модальности, инструменты и API-функции.
- OpenAI Deployment Safety Hub: GPT-5.4 Thinking System Card — официальный контекст мер безопасности семейства и приложение о GPT-5.4 mini; отдельного раздела nano в материале нет.
- LMArena Text Leaderboard — источник Text Arena rating, места и числа пользовательских голосов в зафиксированном паспорте.
- Artificial Analysis: LLM Leaderboard — независимый лидерборд; Intelligence Index для этой конфигурации в переданном срезе отсутствует.
