Запись архива

GPT-5.4 Nano High: обзор модели OpenAI

GPT-5.4 Nano High занимает 80-е место в рейтинге COMRAD404: модель выделяется низкой ценой, длинным контекстом и высокой пользовательской оценкой, но её профиль ограничен отсутствием независимых данных о скорости, кодинге и Intelligence Index.

Профиль GPT-5.4 Nano High с COMRAD Score 61,7, ценой API и контекстом 400 тысяч токенов

GPT-5.4 Nano High стоит выбирать не как универсальную замену крупной reasoning-модели, а как недорогой исполнитель для массовых структурированных операций. Её сильная сторона — сочетание цены, контекста на 400 000 токенов, поддержки рассуждений и заметной пользовательской оценки. Главный риск — неполная измеримость: в срезе нет Artificial Analysis Intelligence Index, отдельного LMArena Code rating и независимых данных о скорости.

Коротко

  • Позиция: 80-е место в редакции рейтинга COMRAD404 2026 H2.
  • COMRAD Score: 61,7 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
  • Лучшие стороны профиля: human preference — 79,8; efficiency — 79,6.
  • Слабые стороны профиля: access — 45,0; quality и coding — по 50,0 при неполном покрытии независимыми метриками.
  • Цена в срезе: $0,20 за миллион входных и $1,25 за миллион выходных токенов.
  • Контекст: 400 000 токенов.
  • Подходящие задачи: классификация, извлечение данных, ранжирование, маршрутизация запросов, вспомогательные агенты и ограниченные операции с кодом.
  • Уровень уверенности: ограниченный из-за пробелов в независимых измерениях.

Паспорт модели

Параметр Значение на 31 августа 2026 года
Модель GPT-5.4 Nano High
Разработчик OpenAI
Статус Стабильная API-модель, не preview
Лицензия Проприетарная
Открытые веса Нет
Reasoning Да; профиль High
COMRAD Score 61,7 из 100
Место 80
LMArena Text 1402,2; 141-е место; 58 539 голосов
Artificial Analysis Intelligence Index Данных в срезе нет
LMArena Code Данных в срезе нет
Цена входа $0,20 за 1 млн токенов
Цена выхода $1,25 за 1 млн токенов
Скорость генерации Данных в срезе нет
Time to first token Данных в срезе нет
Контекст 400 000 токенов

Название High в этом профиле обозначает конфигурацию модели с повышенным уровнем рассуждений. В API базовый идентификатор — gpt-5.4-nano, а режим задаётся параметром reasoning.effort: "high". Это не отдельная архитектура и не самостоятельная открытая модель.

Место в рейтинге

GPT-5.4 Nano High занимает 80-е место в рейтинге моделей ИИ COMRAD404 редакции 2026 H2, рассчитанном по методологии 1.0. Позиция отражает компромисс: модель получает высокие редакционные баллы за пользовательское восприятие и эффективность, но не располагает полным набором независимых измерений, необходимым для уверенной оценки качества, программирования и задержки.

COMRAD Score 61,7 складывается из пяти нормализованных суббаллов с разными весами. Quality даёт 40% итоговой оценки, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. Взвешенный результат до округления равен 61,65. Эти значения нельзя читать как вероятность правильного ответа или долю успешно выполненных задач.

Отдельно важно не смешивать место COMRAD404 и 141-е место в LMArena Text. Это разные рейтинги с разной методикой. COMRAD404 объединяет несколько аспектов модели, тогда как LMArena строится на слепых попарных пользовательских сравнениях. Rating 1402,2 также не означает 1402 правильных ответа или какой-либо процент качества.

Разбор пяти суббаллов

Суббалл Оценка Вес Практическое прочтение
Quality 50,0 40% Средняя редакционная позиция при отсутствии Intelligence Index в зафиксированном срезе.
Human preference 79,8 30% Сильная сторона: модель получила значительный массив слепых сравнений в текстовой арене.
Coding 50,0 15% Нейтральная оценка; отдельного LMArena Code rating нет, поэтому превосходство в программировании не подтверждено.
Efficiency 79,6 10% Выгодный экономический профиль и большой контекст, но без независимой скорости в токенах в секунду.
Access 45,0 5% Доступ через проприетарный API; веса модели не опубликованы.

Наиболее убедительный сигнал — human preference 79,8. Он опирается на LMArena Text rating 1402,2 и 58 539 голосов. Такой объём сравнений делает результат содержательнее единичного лабораторного теста, но арена всё равно измеряет предпочтение пользователей, а не фактическую точность, безопасность или соблюдение бизнес-правил.

Quality и coding по 50,0 следует трактовать осторожно. В паспорте отсутствуют Artificial Analysis Intelligence Index и кодовый рейтинг LMArena. Поэтому эти суббаллы не доказывают среднюю способность модели в буквальном смысле: они обозначают редакционную позицию при ограниченном покрытии источниками.

Возможности и сценарии

Официальная позиция OpenAI: GPT-5.4 nano предназначена для задач, где особенно важны стоимость и масштаб обработки. Разработчик указывает классификацию, извлечение данных, ранжирование и работу вспомогательных агентов как основные сценарии. Документация также подтверждает поддержку текстового и графического ввода, текстового вывода, function calling и structured outputs.

Редакционная интерпретация: модель имеет смысл ставить в те участки конвейера, где запрос можно формализовать, результат автоматически проверить, а ошибка не приводит напрямую к необратимому действию. Типовые варианты:

  • распределение обращений по очередям и категориям;
  • извлечение реквизитов, дат, сущностей и статусов из документов;
  • преобразование текста в JSON по фиксированной схеме;
  • предварительное ранжирование результатов поиска;
  • проверка формата и полноты карточек товаров;
  • суммаризация больших пакетов однотипных материалов;
  • поиск файлов и фрагментов кода вспомогательным субагентом;
  • черновые точечные правки с обязательным запуском тестов;
  • маршрутизация сложных запросов к более мощной модели.

Официальная документация указывает поддержку web search, file search, code interpreter, hosted shell, apply patch, MCP и генерации изображений через Responses API. При этом computer use для GPT-5.4 nano не поддерживается. Наличие инструмента не гарантирует, что модель будет безошибочно выбирать момент вызова или правильно интерпретировать результат: эти свойства нужно проверять отдельно.

Режим High и интеграция

GPT-5.4 nano поддерживает уровни reasoning effort от none до xhigh. Рассматриваемый профиль использует high. Повышенный effort может помочь в многошаговой классификации, выборе инструментов и задачах с зависимыми ограничениями, но способен увеличить число рассуждающих и выходных токенов, стоимость и задержку.

{
  "model": "gpt-5.4-nano",
  "reasoning": {"effort": "high"},
  "input": "Проверь документ по правилам и верни JSON"
}

Не стоит устанавливать High для всех запросов по умолчанию. Для простого определения языка, извлечения одного поля или выбора категории полезно сравнить none, low, medium и high. Победителем должен стать режим с лучшим результатом на вашем наборе данных при приемлемой стоимости и задержке, а не конфигурация с максимальным объёмом рассуждений.

Цена и скорость

В паспорте зафиксирована цена $0,20 за миллион входных и $1,25 за миллион выходных токенов. Например, 10 млн входных и 1 млн выходных токенов по этим ставкам обойдутся в $3,25. Нагрузка из 100 млн входных и 10 млн выходных токенов — в $32,50. Это расчёт токенной части без стоимости инструментов, хранения, поиска, инфраструктуры, повторных запросов и контроля качества.

Цена особенно привлекательна для конвейеров с коротким структурированным ответом. Если модель получает длинный документ, но возвращает несколько полей JSON, выходная часть счёта остаётся ограниченной. Для разговорного интерфейса с многословными ответами разница между входной и выходной ставкой становится заметнее.

Цены зависят от API-провайдера, режима обработки и дополнительных функций и могут измениться после даты среза. Их нельзя использовать как бессрочное коммерческое предложение. Перед запуском следует сверять действующий прайс и считать реальное потребление, включая reasoning-токены и повторные попытки.

Независимых значений output tokens per second и time to first token в паспорте нет. Поэтому высокий efficiency 79,6 не следует переводить в обещание мгновенного ответа. Задержка зависит от reasoning effort, длины контекста, нагрузки провайдера, региона, инструментов и объёма вывода.

Контекст и длинные документы

Контекст на 400 000 токенов позволяет передавать крупные наборы документов, длинные инструкции и значительную часть репозитория. Но размер окна — это технический предел ввода, а не гарантия одинакового внимания к каждому фрагменту. Чем больше материал, тем важнее проверять поиск редких фактов, соблюдение дальних зависимостей и устойчивость к противоречащим инструкциям внутри документов.

Для практического применения длинного контекста лучше заранее размечать источники, нумеровать документы и требовать ссылки на идентификаторы фрагментов. Если задача допускает retrieval, часто выгоднее сначала выбрать релевантные части, а затем передать их модели. Это уменьшает стоимость и упрощает аудит ответа.

В паспорте отсутствует отдельная независимая оценка качества длинного контекста. Поэтому 400 000 токенов говорят о вместимости запроса, но не подтверждают точность извлечения на всём диапазоне окна.

Ограничения

  • Неполное покрытие бенчмарками. В срезе нет Artificial Analysis Intelligence Index и LMArena Code rating.
  • Нет независимой скорости. Значения токенов в секунду и времени до первого токена отсутствуют.
  • Проприетарность. Веса закрыты, локальное развёртывание и независимый аудит параметров недоступны.
  • High не гарантирует лучший результат. Дополнительное рассуждение может повышать стоимость и задержку без измеримого выигрыша.
  • Рейтинг предпочтений не равен точности. LMArena отражает выбор участников в слепых парах, а не прохождение ваших бизнес-проверок.
  • Кодинг подтверждён ограниченно. Модель можно тестировать как вспомогательного кодового агента, но паспорт не содержит отдельного кодового рейтинга.
  • Длинный контекст не равен идеальной памяти. Важные факты могут теряться среди нерелевантного текста.
  • Нет открытых весов. GPT-5.4 Nano High нельзя называть открытым ПО или open-weight моделью.

В найденных официальных материалах не указаны размер модели в параметрах и подробная архитектура GPT-5.4 nano. Отдельная model card именно для nano также не была обнаружена: опубликованный OpenAI материал по безопасности GPT-5.4 содержит приложение о mini, но не даёт сопоставимого самостоятельного профиля nano. Восстанавливать эти сведения по аналогии с другими версиями нельзя.

Как проверить на своей задаче

  1. Соберите закрытый набор. Возьмите не менее нескольких десятков реальных примеров, включая редкие, неоднозначные и ошибочно оформленные входы.
  2. Определите проверяемый результат. Для классификации используйте accuracy или F1, для извлечения — точное совпадение полей, для кода — тесты и статический анализ.
  3. Зафиксируйте API-версию. Для воспроизводимости используйте доступный snapshot, а не только плавающий alias.
  4. Сравните effort. Прогоните одинаковые примеры на none, low, medium и high.
  5. Измерьте задержку. Записывайте медиану, p95, время до первого токена и полную длительность с учётом инструментов.
  6. Считайте стоимость успешной операции. Учитывайте не один запрос, а повторы, исправления JSON, reasoning-токены и эскалации.
  7. Проверьте устойчивость. Меняйте порядок документов, добавляйте нерелевантный текст и перефразируйте инструкции.
  8. Разделите риск. Для платежей, публикации, удаления данных и юридически значимых решений оставьте детерминированную проверку или подтверждение человеком.

Главная метрика для выбора — не цена миллиона токенов, а стоимость одного принятого результата. Дешёвая модель перестаёт быть дешёвой, если требует много повторов или создаёт ошибки, которые приходится исправлять вручную.

Кому подходит

GPT-5.4 Nano High подходит командам, у которых есть большой поток однотипных запросов, строгая схема результата и автоматическая проверка. Особенно логична роль первого уровня: модель извлекает, классифицирует и ранжирует, а сложные или неуверенные случаи передаёт более сильному обработчику либо человеку.

Модель менее убедительна как единственный исполнитель открытых исследовательских задач, критичных изменений кода и решений, где нужна доказанная независимыми тестами точность. Для таких сценариев паспорт оставляет слишком много неизвестных: нет Intelligence Index, кодового рейтинга и измеренной скорости.

FAQ

Что означает High в названии GPT-5.4 Nano High?

Это профиль запуска GPT-5.4 nano с параметром reasoning.effort: "high", а не отдельный API slug или другая архитектура.

Является ли COMRAD Score 61,7 процентом качества?

Нет. Это нормализованная редакционная оценка по шкале от 0 до 100, собранная из пяти суббаллов с разными весами.

Что означает LMArena rating 1402,2?

Это статистический рейтинг, рассчитанный по слепым попарным сравнениям ответов. Он не является процентом правильных ответов. В срезе учтено 58 539 голосов.

Насколько быстро работает модель?

В паспорте нет данных о токенах в секунду и времени до первого токена. Скорость нужно измерять у выбранного API-провайдера на собственных запросах и в нужном reasoning-режиме.

Подходит ли GPT-5.4 Nano High для программирования?

Её можно применять для точечных правок, навигации по коду и вспомогательных субагентов, но отдельный LMArena Code rating отсутствует. Качество следует подтверждать тестами репозитория.

Можно ли развернуть модель локально?

Нет доступных открытых весов. Модель проприетарная и предоставляется через API.

Гарантирует ли контекст 400 000 токенов точную работу со всем документом?

Нет. Контекст обозначает доступную вместимость, но не гарантирует одинаковое внимание, поиск всех деталей или устойчивость к помехам.

Источники

  • OpenAI: Introducing GPT-5.4 mini and nano — официальный анонс, дата выпуска, позиционирование, доступность и цена GPT-5.4 nano.
  • OpenAI API: GPT-5.4 nano Model — идентификатор модели, reasoning effort, контекст, модальности, инструменты и API-функции.
  • OpenAI Deployment Safety Hub: GPT-5.4 Thinking System Card — официальный контекст мер безопасности семейства и приложение о GPT-5.4 mini; отдельного раздела nano в материале нет.
  • LMArena Text Leaderboard — источник Text Arena rating, места и числа пользовательских голосов в зафиксированном паспорте.
  • Artificial Analysis: LLM Leaderboard — независимый лидерборд; Intelligence Index для этой конфигурации в переданном срезе отсутствует.