GPT-5.5 High — модель для сложной интеллектуальной работы, но не универсальный лидер по совокупности критериев. В срезе COMRAD404 2026 H2 она занимает 81-е место с COMRAD Score 61,6 из 100: это результат заметной силы в пользовательских текстовых сравнениях, умеренного кодового профиля и слабой обеспеченности данными по эффективности.
Главный практический вывод такой: GPT-5.5 High имеет смысл выбирать для задач, где важны рассуждение, самостоятельная проработка большого контекста, редактирование, анализ документов и многошаговая работа с кодом. Для решений, в которых критичны предсказуемая стоимость, подтверждённая скорость или прозрачное распространение весов, паспорт модели оставляет существенные вопросы.
Ниже разделены три типа сведений: официальные заявления OpenAI, независимые измерения LMArena и редакционные оценки COMRAD404. Числа рейтинга относятся к зафиксированному срезу на 31 августа 2026 года и не должны восприниматься как постоянные характеристики модели.
Коротко
- Модель: GPT-5.5 High.
- Разработчик: OpenAI.
- Место в рейтинге COMRAD404: 81.
- COMRAD Score: 61,6 из 100.
- Сильнейший независимый сигнал: LMArena Text — рейтинг 1482,4 и 16-е место.
- Кодовый сигнал: LMArena Code — рейтинг 1457,8 и 49-е место.
- Цена в паспорте: 5 долларов за миллион входных токенов и 30 долларов за миллион выходных токенов.
- Контекст: 1 050 000 токенов.
- Чего нет в срезе: Artificial Analysis Intelligence Index, скорость генерации и время до первого токена.
- Режим распространения: проприетарная модель без открытых весов.
Паспорт модели
| Параметр | Значение | Как читать |
|---|---|---|
| Название | GPT-5.5 High | Конкретная конфигурация, указанная в паспорте |
| Организация | OpenAI | Разработчик модели |
| Лицензия | Proprietary | Условия использования определяются правообладателем |
| Reasoning | Да | Модель учитывает режим рассуждения как часть профиля |
| Preview | Нет | В паспорте модель не обозначена как preview |
| COMRAD Score | 61,6 / 100 | Нормализованная редакционная оценка, не процент правильных ответов |
| Контекст | 1 050 000 токенов | Заявленный в зафиксированном паспорте объём контекста |
| Вход | $5 / 1 млн токенов | Стоимость зависит от провайдера и режима |
| Выход | $30 / 1 млн токенов | Выходные токены существенно дороже входных |
Поле confidence: средняя означает, что редакция не рассматривает итоговый профиль как полностью подтверждённый всеми желательными источниками. В частности, в паспорте отсутствует значение Artificial Analysis Intelligence Index, а поля скорости и времени до первого токена не заполнены.
Место в рейтинге
Позиция 81 объясняется не одним провалом и не одним выдающимся результатом, а сочетанием разнонаправленных суббаллов. GPT-5.5 High получила высокий сигнал по предпочтению пользователей, достаточно сильный кодовый балл, средний балл качества и доступа, а также нулевую редакционную оценку эффективности. Поэтому итоговый результат заметно ниже, чем можно было бы ожидать только по текстовому рейтингу LMArena.
В общем рейтинге COMRAD404 COMRAD Score нужно читать как нормализованную редакционную шкалу от 0 до 100. Это не вероятность успешного ответа, не доля решённых задач и не процент пользователей, выбравших модель. Сама позиция также является срезом конкретной редакции рейтинга — 2026 H2 при методологии версии 1.0.
Независимые данные LMArena выглядят для модели лучше, чем сводный балл: в Text Arena GPT-5.5 High имеет рейтинг 1482,4, 16-е место и 61 604 голоса. В Code Arena указаны рейтинг 1457,8 и 49-е место. Рейтинг LMArena формируется статистически по слепым попарным сравнениям ответов, поэтому его нельзя трактовать как процент правильных ответов или универсальную оценку всех рабочих сценариев.
Разница между текстовым и кодовым местом важна для выбора. Модель заметно убедительнее выглядит в общем текстовом взаимодействии, чем в независимом кодовом сравнении. Это не означает, что она плохо программирует; это означает, что кодовый профиль не является настолько же сильным относительно других участников соответствующей арены.
Что означают пять суббаллов
| Суббалл | Оценка | Интерпретация |
|---|---|---|
| Quality | 50,0 / 100 | Средняя редакционная оценка общего качества профиля |
| Human preference | 100,0 / 100 | Максимальный вклад сигналов пользовательского предпочтения в данной шкале |
| Coding | 60,8 / 100 | Умеренно сильный кодовый профиль по доступным данным |
| Efficiency | 0,0 / 100 | В редакционном срезе эффективность не получила положительного балла |
| Access | 50,0 / 100 | Средняя оценка доступности в используемой редакционной модели |
Суббаллы — это также оценки от 0 до 100, а не проценты качества. Максимальный Human preference не следует превращать в утверждение, что все пользователи предпочитают модель или что она всегда отвечает лучше. Это нормализованный вклад текстовых пользовательских сравнений в формулу COMRAD404.
Нулевой Efficiency требует особенно осторожного чтения. В паспорте нет значения output tokens per second и нет time to first token seconds. Следовательно, редакция не может подтвердить конкретную скорость и не должна делать вывод, будто модель обязательно медленная. Корректнее сказать: в данном срезе эффективность не подтверждена измерениями, пригодными для положительной оценки.
Средний Access также не описывает доступность во всех регионах, тарифах или интеграциях. Это редакционный суббалл, рассчитанный по методике рейтинга. Для закупки API или выбора конкретного интерфейса его нужно проверять отдельно.
Возможности и сценарии
OpenAI позиционирует GPT-5.5 как модель для сложной профессиональной работы: программирования, исследования, анализа информации, подготовки документов и выполнения задач через инструменты. В официальных материалах отдельно подчёркиваются многошаговое планирование, проверка промежуточных результатов и способность продолжать работу после неоднозначного шага. Это заявление разработчика, а не независимое подтверждение каждой из возможностей в любых условиях.
Код и инженерные задачи
Для разработчика GPT-5.5 High интересна там, где требуется не только дописать функцию, но и удержать контекст проекта: разобраться в структуре репозитория, локализовать причину сбоя, предложить изменение, написать тесты и проверить побочные эффекты. Редакционный Coding 60,8 и 49-е место в Code Arena указывают на рабочую пригодность, но не дают оснований обещать автономное закрытие любого issue.
Лучший режим применения — делегирование ограниченного, проверяемого участка работы. Например, можно поручить модели анализ трассировки, подготовку плана миграции, рефакторинг отдельного модуля или генерацию тестов с явным требованием перечислить допущения. Финальный diff, зависимости, безопасность и результаты тестов всё равно должен проверять человек.
Документы, исследования и аналитика
Контекст в 1 050 000 токенов делает модель потенциально удобной для длинных материалов: технической документации, набора договоров, большого отчёта, переписки по проекту или корпуса внутренних заметок. Большое окно не гарантирует, что модель безошибочно извлечёт каждую деталь. На длинных входах полезно просить её составить карту источников, указать места, на которых основан вывод, и отдельно пометить неопределённость.
Для аналитики GPT-5.5 High можно использовать как промежуточного исследовательского помощника: сформулировать гипотезы, классифицировать материалы, подготовить структуру отчёта, написать код обработки данных и предложить проверки. В задачах с юридическими, медицинскими, финансовыми или операционными последствиями результат следует рассматривать как черновик для экспертной верификации.
Многошаговая работа
Наличие reasoning в паспорте означает, что модель относится к классу систем с режимом рассуждения. На практике это полезно для задач с несколькими ограничениями, конфликтующими требованиями и необходимостью сравнивать варианты. Однако reasoning не отменяет ошибок в исходных данных, неверных предпосылок и недостатка внешних инструментов.
Чтобы получить пользу от такого профиля, лучше задавать не только вопрос, но и критерии готового результата: формат, допустимые источники, список обязательных проверок, ограничения по времени и условия остановки. Это снижает риск получить длинный, но непроверяемый ответ.
Цена и скорость
В паспорте указана цена $5 за миллион входных токенов и $30 за миллион выходных токенов. Такой порядок цен означает, что длинный ответ или многошаговый запуск может стоить существенно дороже, чем первоначальная передача документов. При расчёте бюджета нужно учитывать не только пользовательский запрос, но и историю диалога, повторные попытки, результаты инструментов и автоматически добавляемый контекст.
OpenAI на официальной странице API указывает те же базовые значения для GPT-5.5 и контекстное окно 1 050 000 токенов. При этом условия для больших входов, кэширования, пакетной обработки и приоритетных режимов могут отличаться от стандартного тарифа. Поэтому цифры из паспорта — ориентир конкретного среза, а не обещание неизменной цены для каждого провайдера и режима.
Скорость генерации в паспорте не указана: output_tokens_per_second: нет данных, time_to_first_token_seconds: нет данных. Нельзя корректно назвать среднее время ответа, пропускную способность или преимущество над другой моделью. При выборе для интерактивного продукта эти параметры необходимо измерить самостоятельно на том API, который будет использоваться в эксплуатации.
Практическая стоимость зависит от архитектуры приложения. Если модель получает большой документ на каждом запросе и генерирует подробные рассуждения, расход будет выше. Если документы предварительно индексируются, ответы ограничиваются нужным форматом, а повторяющиеся части кэшируются, бюджет можно контролировать точнее. Эти меры не меняют паспортную цену, но меняют фактическую стоимость сценария.
Ограничения
Неполная измерительная картина. В срезе нет Artificial Analysis Intelligence Index. Восстанавливать его по другим рейтингам нельзя: это отдельная метрика с собственной методикой и единицами. Также отсутствуют независимые значения скорости и времени до первого токена.
Закрытая модель. Лицензия указана как Proprietary, а open_weights — false. Пользователь получает доступ к сервису или API на условиях провайдера, но не получает открытые веса для самостоятельного развёртывания. Это важно для требований к локальному запуску, аудиту, контролю обновлений и переносимости.
Цена рассуждений. Большое контекстное окно и способность выполнять многошаговую работу могут повышать расход токенов. Для массовой классификации коротких текстов такой профиль может быть избыточным, особенно если задача решается простым детерминированным кодом или более дешёвой моделью.
Проверка фактов обязательна. Сильная текстовая позиция в LMArena отражает предпочтения в слепых сравнениях, а не гарантирует точность в корпоративной базе знаний. Кодовый рейтинг также не заменяет тесты безопасности, производительности и корректности конкретного проекта.
Официальные заявления не равны независимому аудиту. OpenAI описывает модель как систему для кодинга, профессиональной работы и задач с инструментами; system card раскрывает подход к оценке рисков и мерам безопасности. Эти материалы полезны для понимания заявленного назначения, но не заменяют собственные тесты на ваших данных.
Как проверить на своей задаче
- Зафиксируйте задачу и критерий успеха. Опишите, что считается правильным ответом, какие ошибки критичны и когда результат нужно отправлять на ручную проверку.
- Соберите эталонный набор. Возьмите реальные примеры из работы: простые, типичные, пограничные и заведомо сложные. Не ограничивайтесь удачными демонстрациями.
- Разделите качество и стоимость. Записывайте точность, полноту, число исправлений, входные и выходные токены отдельно. Нельзя заменять стоимость оценкой качества или наоборот.
- Измерьте задержку. Для каждого запроса фиксируйте время до первого токена и время полного ответа. Делайте несколько повторов в одинаковых условиях, потому что нагрузка провайдера меняется.
- Проверьте длинный контекст. Разложите факты по разным частям документа и задайте вопросы, требующие их связать. Отдельно проверьте, не придумывает ли модель сведения, которых во входе нет.
- Для кода используйте тестовый репозиторий. Измерьте долю принятых изменений, количество регрессий, успешность тестов, время ревью и необходимость ручной переработки.
- Проверьте отказоустойчивость. Добавьте неполные данные, противоречивые инструкции, неожиданные форматы и вредоносные фрагменты. Оцените, задаёт ли модель уточняющие вопросы и корректно ли останавливается.
- Сравните режимы API. Если провайдер предлагает кэширование, batch, flex или приоритетную обработку, считайте их отдельными конфигурациями. Цена и скорость между режимами не должны смешиваться.
- Примите решение по полной стоимости владения. Включите обработку ошибок, наблюдаемость, хранение данных, ручную проверку, повторные запуски и стоимость интеграции.
Минимальный практический тест для GPT-5.5 High — это не один сложный промпт, а серия одинаковых задач с заранее известным эталоном. Для каждой попытки полезно хранить версию промпта, входные данные, режим reasoning, число токенов, задержку и итог ручной проверки. Так можно отделить случайно удачный ответ от устойчивого поведения.
Кому стоит выбрать GPT-5.5 High
Модель подходит командам, которым нужен закрытый API для сложных задач, где важны качество текста, работа с большим контекстом и многошаговое рассуждение. Наиболее естественные сценарии — техническое редактирование, разбор больших документов, подготовка исследовательских материалов, прототипирование, ревью кода и автоматизация внутренних операций под контролем специалиста.
Выбор выглядит менее очевидным для потоковой обработки с жёстким бюджетом, приложений, где задержка должна быть заранее гарантирована, и систем, которым требуется локальное развёртывание с доступом к весам. В таких случаях отсутствие данных по скорости и закрытый режим распространения становятся не второстепенными деталями, а частью архитектурного риска.
FAQ
Какое место занимает GPT-5.5 High?
В редакционном рейтинге COMRAD404 2026 H2 модель занимает 81-е место и получает COMRAD Score 61,6 из 100. Это нормализованная оценка профиля, а не процент качества.
Сильна ли GPT-5.5 High в текстовых задачах?
В паспорте у неё LMArena Text rating 1482,4, 16-е место и 61 604 голоса. Это сильный сигнал пользовательского предпочтения в слепых попарных сравнениях, но не гарантия точности на любой прикладной задаче.
Подходит ли модель для программирования?
Да, её можно рассматривать для кодинга и многошаговой инженерной работы. Однако LMArena Code указывает 1457,8 и 49-е место, а редакционный Coding суббалл равен 60,8, поэтому изменения нужно проверять тестами и ревью.
Сколько стоит GPT-5.5 High?
В паспорте указано 5 долларов за миллион входных токенов и 30 долларов за миллион выходных токенов. Фактические расходы зависят от API-провайдера, режима обработки, кэширования, длины контекста и количества повторных запусков.
Какая скорость у GPT-5.5 High?
В зафиксированном срезе нет данных ни по output tokens per second, ни по time to first token seconds. Поэтому нельзя честно назвать среднюю скорость; её следует измерить самостоятельно на выбранном API.
Можно ли запустить модель локально?
Паспорт указывает лицензию Proprietary и отсутствие открытых весов. Он не подтверждает возможность локального развёртывания с собственными весами; доступ нужно рассматривать через предусмотренные OpenAI продукты или API.
Есть ли у модели официальный model card?
Да. Для GPT-5.5 опубликована официальная system card, описывающая назначение модели, подготовительные оценки безопасности и меры защиты. Это материал OpenAI, а не независимый бенчмарк.
Источники
- Introducing GPT-5.5 — официальный материал OpenAI о назначении, возможностях, доступности и базовой цене.
- GPT-5.5 Model в документации OpenAI API — официальные сведения о модели, reasoning, контексте и тарифе API.
- GPT-5.5 System Card — официальный документ о безопасности, оценках и защитных мерах.
- LMArena Text Leaderboard — независимые данные Text Arena, использованные в паспорте.
- LMArena Leaderboard — независимые данные Code Arena, использованные в кодовом суббалле.
- Artificial Analysis: LLM Leaderboard — источник для отдельного Intelligence Index и связанных с ним показателей; значение этой метрики в паспорте GPT-5.5 High отсутствует.
Дата среза паспорта и редакционных выводов: 31 августа 2026 года. Обновления рейтингов, тарифов, доступности и документации могут изменить практическую оценку модели.
