Запись архива

Grok 4.5: сильная модель для кода с дорогой задержкой

Grok 4.5 занимает 15-е место в рейтинге COMRAD404: у модели высокие оценки качества, пользовательских предпочтений и кодинга, но слабая эффективность. Разбираем API-цену, задержку, контекст 500 000 токенов и подходящие сценарии.

Профиль Grok 4.5 с оценками качества, кодинга, эффективности, цены и скорости

Grok 4.5 стоит выбирать не ради мгновенных ответов, а для задач, где качество рассуждения, код и работа с большим контекстом важнее стартовой задержки. Модель занимает 15-е место в редакционном срезе COMRAD404 2026 H2. Её профиль неравномерный: качество и пользовательские предпочтения близки к верхней части шкалы, кодинг также силён, однако эффективность заметно снижает итоговую позицию.

Коротко

  • Главное преимущество: сочетание высокого качества, сильного результата в кодинге и контекста на 500 000 токенов.
  • Главный недостаток: время до первого токена 14,51 секунды при независимом измерении, отражённом в паспорте.
  • Лучшие сценарии: исправление и анализ кода, агентные инженерные задачи, работа с крупными наборами документов, подготовка структурированных материалов.
  • Менее удачные сценарии: интерактивные интерфейсы, где пользователь ожидает почти мгновенной реакции, и массовая обработка простых запросов с жёстким бюджетом.
  • Доступ: проприетарная модель без открытых весов, доступная через API и продукты разработчика.

Паспорт модели

Параметр Значение в срезе
Модель Grok 4.5
Разработчик SpaceXAI
Место COMRAD404 15
COMRAD Score 86,0 из 100
Статус Не preview
Лицензия и веса Проприетарная, открытые веса отсутствуют
Рассуждение Поддерживается
Artificial Analysis Intelligence Index 55,8
LMArena Text 1469,6; место 36; 24 152 голоса
LMArena Code 1555,6; место 20
Базовая цена API $2 за 1 млн входных и $6 за 1 млн выходных токенов
Независимая скорость 54,2 выходного токена в секунду
Время до первого токена 14,51 секунды
Контекст 500 000 токенов
Уверенность паспорта Высокая

COMRAD Score и его суббаллы являются нормализованными редакционными оценками по шкале 0–100, а не процентами качества. Intelligence Index, рейтинги LMArena, цена, скорость и размер контекста используют собственные единицы и не должны сравниваться между собой как одна шкала.

Место в рейтинге

В рейтинге моделей ИИ COMRAD404 редакции 2026 H2 Grok 4.5 находится на 15-м месте с результатом 86,0. Итог рассчитан по методологии 1.0: качество имеет вес 40%, пользовательские предпочтения — 30%, кодинг — 15%, эффективность — 10%, доступность — 5%.

Позиция объясняется не недостатком интеллектуальных возможностей, а дисбалансом профиля. Три наиболее весомые оценки — качество, предпочтение людей и кодинг — высоки. Но эффективность равна только 28,5. Даже при весе 10% этот показатель отнимает достаточно баллов, чтобы модель не поднялась выше. Доступность на уровне 71,2 также не максимальна: API существует, но веса закрыты, лицензия проприетарная, а воспроизводимость зависит от инфраструктуры провайдера.

Итог 86,0 получается после округления взвешенной суммы суббаллов. Это оценка пригодности модели в общей системе COMRAD404, а не утверждение, что она правильно выполняет 86% любых запросов.

Разбор пяти суббаллов

Суббалл Оценка Вес Редакционная интерпретация
Качество 92,5 40% Сильный общий интеллектуальный профиль
Предпочтение людей 98,3 30% Ответы высоко оцениваются в слепых сравнениях
Кодинг 87,3 15% Подходит для содержательных инженерных задач
Эффективность 28,5 10% Слабое место из-за задержки, скорости и экономики запуска
Доступность 71,2 5% Есть API, но нет открытых весов и самостоятельного развёртывания

Качество 92,5 опирается в том числе на Intelligence Index 55,8, но эти два числа нельзя отождествлять: первое является нормализованным редакционным суббаллом, второе — отдельным индексом Artificial Analysis.

Предпочтение людей 98,3 согласуется с высоким LMArena Text rating 1469,6, полученным по 24 152 голосам. Rating LMArena — статистическая величина из слепых попарных сравнений, а не доля правильных ответов. Указанное в паспорте 36-е место относится к конкретному текстовому срезу LMArena и не обязано совпадать с общей позицией COMRAD404.

Кодинг 87,3 поддерживается результатом Code Arena: rating 1555,6 и 20-е место. Это хороший сигнал для выбора модели-разработчика, но не гарантия успешной работы с конкретным репозиторием, стеком или внутренними библиотеками компании.

Что умеет Grok 4.5

Официальная документация описывает Grok 4.5 как модель для программирования, агентной разработки, инженерных и рабочих процессов. Она принимает текст и изображения, поддерживает вызов функций, структурированный вывод и контекст на 500 000 токенов. В API используются идентификатор grok-4.5 и обновляемые псевдонимы, включая grok-4.5-latest. ([docs.x.ai](https://docs.x.ai/developers/models/grok-4.5?utm_source=openai))

Разработчик отдельно позиционирует модель для coding, agentic tasks и knowledge work. В официальном анонсе приводятся собственные и сторонние инженерные тесты, однако эти результаты являются материалами разработчика и не подменяют независимые показатели из паспорта COMRAD404. Публичный анонс датирован 16 июля 2026 года, тогда как release notes фиксируют доступность модели в API уже 8 июля 2026 года. ([x.ai](https://x.ai/news/grok-4-5?utm_source=openai))

Для рассуждения предусмотрены уровни low, medium и high; последний используется по умолчанию. Отключить reasoning полностью нельзя. Выбор режима важен практически: низкий уровень стоит тестировать для коротких инструментальных шагов, высокий — для сложной логики, анализа и исправлений, где дополнительная задержка оправданна. ([docs.x.ai](https://docs.x.ai/developers/model-capabilities/text/reasoning?utm_source=openai))

Возможности и сценарии

Разработка и сопровождение кода

Grok 4.5 имеет смысл включать в отбор для анализа ошибок, подготовки патчей, рефакторинга, написания тестов и объяснения незнакомого проекта. Особенно полезны задачи, где модели передаются спецификация, связанные файлы, журнал ошибки и критерии приёмки. Высокий кодовый суббалл говорит в пользу такого пилота, но автономное изменение репозитория следует запускать только в изолированной ветке с тестами, линтером и обязательным просмотром diff.

Агентные рабочие процессы

Поддержка function calling позволяет использовать модель как планировщик и исполнитель последовательности действий: запросить данные, проверить формат, вызвать внутренний сервис, проанализировать ответ и подготовить итог. Сильная модель не отменяет инженерных ограничителей: список инструментов должен быть минимальным, аргументы — валидироваться схемой, а опасные действия — требовать подтверждения.

Большие документы и базы знаний

Контекст в 500 000 токенов подходит для крупных комплектов документации, длинных обсуждений, контрактов, требований и частей кодовой базы. Это лимит вместимости, а не обещание одинаково точного внимания к каждому фрагменту. Для надёжной работы полезно размечать документы, просить указывать источник утверждения и отдельно проверять сведения, расположенные в начале, середине и конце контекста.

Изображения и структурированные ответы

Поддержка изображений позволяет передавать скриншоты интерфейсов, схемы или визуальные фрагменты документа. Structured outputs полезны, когда ответ должен соответствовать JSON-схеме либо дальше обрабатываться программой. Для критичного конвейера всё равно требуется серверная валидация: формальная корректность структуры не подтверждает истинность содержимого.

Контекст, знания и поиск

Официальная документация указывает дату отсечения знаний 1 февраля 2026 года. События после этой даты нельзя считать известными модели без подключения актуального источника. Для запросов о новостях, ценах, версиях ПО, законодательстве или текущем состоянии сервиса следует включать Web Search либо передавать собственные документы. ([docs.x.ai](https://docs.x.ai/developers/models?cluster=us-east-1&utm_source=openai))

Поиск является инструментом, а не встроенной гарантией достоверности. В рабочем приложении нужно сохранять использованные источники, ограничивать допустимые домены, проверять даты публикации и разделять извлечённые факты от вывода модели. Для закрытой корпоративной информации предпочтительнее собственный retrieval-контур с журналированием доступа.

Псевдоним с окончанием -latest удобен для получения обновлений, но создаёт риск изменения поведения без правок в приложении. Для воспроизводимых тестов фиксируйте фактический идентификатор модели, параметры reasoning, системную инструкцию, набор инструментов и дату запуска.

Цена и скорость

В паспорте зафиксирована базовая API-цена: $2 за миллион входных и $6 за миллион выходных токенов. Официальный прайс SpaceXAI на 31 августа 2026 года уточняет, что эти ставки относятся к запросам короче 200 000 входных токенов. Для длинного контекста от 200 000 токенов указаны $4 за миллион входных и $12 за миллион выходных токенов. Кэшированный ввод оценивался в $0,30 либо $0,60 в зависимости от длины контекста. Тарифы могут изменяться и отличаться у посредников. ([docs.x.ai](https://docs.x.ai/developers/pricing?utm_source=openai))

Пример для короткого контекста: 150 000 входных и 20 000 выходных токенов дают ориентировочно $0,42 без учёта инструментов и других начислений. Для 250 000 входных и 20 000 выходных токенов по длинному тарифу ориентир составляет $1,24. Реальная сумма зависит от токенизации, reasoning-токенов, кэширования, повторных вызовов и условий провайдера.

Независимый срез показывает 54,2 выходного токена в секунду и 14,51 секунды до первого токена. Это разные этапы задержки: пользователь сначала ждёт начала ответа, после чего текст генерируется с указанной средней скоростью. При линейной оценке вывод 2 000 токенов займёт около 37 секунд после старта, а суммарное ожидание приблизится к 51 секунде. Реальные результаты зависят от нагрузки, региона, длины запроса, режима reasoning и инструментов.

В официальном анонсе разработчик сообщал о скорости 80 токенов в секунду в собственном окружении. COMRAD404 использует независимое значение 54,2 из паспорта, поскольку условия замера производителя и внешнего сервиса могут различаться. ([x.ai](https://x.ai/news/grok-4-5?utm_source=openai))

Ограничения

  • Низкая эффективность: суббалл 28,5 делает модель спорным выбором для чатов, автодополнения и массовых коротких операций.
  • Закрытые веса: локальное развёртывание, аудит параметров и независимое обслуживание недоступны. Проприетарную модель нельзя называть открытым программным обеспечением.
  • Зависимость от API: доступность определяется тарифами, лимитами, регионами и правилами провайдера.
  • Длинный контекст дороже: официальный тариф на дату среза повышается после порога в 200 000 входных токенов.
  • Нет автоматической актуальности: для сведений после 1 февраля 2026 года нужен поиск или предоставленный источник.
  • Reasoning нельзя отключить: даже режим low использует рассуждение, что следует учитывать в задержке и стоимости.
  • Рейтинги не равны надёжности: высокий LMArena rating не гарантирует правильных юридических, финансовых, медицинских или фактических ответов.
  • Недостаток раскрытия: в найденных официальных материалах нет отдельной model card именно для Grok 4.5 и репозитория её весов. Данные об архитектуре и числе параметров в срезе отсутствуют, поэтому восстанавливать их по материалам о других версиях нельзя.

Кому модель подходит

Grok 4.5 выглядит рациональным кандидатом для команд, которые могут принять задержку ради качества: разработчиков агентных систем, внутренних инженерных помощников, аналитических конвейеров и сервисов обработки больших документов. Особенно уместен пилот, если на входе много связанного контекста, а на выходе требуется не короткая реплика, а законченный артефакт — патч, отчёт, спецификация или структурированный план.

Модель менее привлекательна для мгновенных подсказок в интерфейсе, голосовых диалогов, классификации миллионов простых записей и задач, где закрытая лицензия нарушает требования к размещению данных. В таких случаях важнее не общий COMRAD Score, а собственные показатели p95-задержки, цены успешной операции и доли ответов, прошедших проверку.

Как проверить на своей задаче

  1. Соберите репрезентативный набор. Возьмите не менее 30–100 реальных запросов: типичные случаи, сложные примеры, ошибки пользователей и намеренно неоднозначные данные.
  2. Зафиксируйте конфигурацию. Сохраните идентификатор модели, системный промпт, уровень reasoning, параметры инструментов, регион API и дату теста.
  3. Разделите критерии. Оценивайте фактическую правильность, полноту, соблюдение формата, число исправлений человеком, время до первого токена, полное время и стоимость.
  4. Сравните режимы reasoning. Проверьте low, medium и high на одном наборе. Высокий режим стоит оставлять только там, где прирост качества покрывает задержку и расходы.
  5. Для кода используйте песочницу. Запускайте тесты, статический анализ и проверку зависимостей. Считайте успешным не красивое объяснение, а патч, прошедший критерии репозитория.
  6. Испытайте длинный контекст. Поместите важные факты в разные части документов, добавьте противоречивые версии и потребуйте сослаться на конкретный фрагмент.
  7. Проверьте актуальность. Дайте вопросы о событиях после 1 февраля 2026 года сначала без поиска, затем с контролируемыми источниками. Сравните число неподтверждённых утверждений.
  8. Задайте порог внедрения заранее. Например: не менее 90% ответов проходят проверку формата, не более определённой цены за успешную задачу и приемлемая p95-задержка.

Для Grok 4.5 особенно важно измерять не только среднее качество, но и стоимость завершённой задачи. Более дорогой единичный вызов может оказаться выгодным, если модель реже требует повторных попыток; обратная ситуация также возможна.

FAQ

Grok 4.5 — открытая модель?

Нет. По паспорту она распространяется проприетарно, а открытые веса отсутствуют. Наличие публичного API не делает модель открытым программным обеспечением.

Какое место Grok 4.5 занимает в COMRAD404?

В срезе 2026 H2 модель занимает 15-е место с COMRAD Score 86,0. Это нормализованная редакционная оценка, а не процент правильных ответов.

Подходит ли Grok 4.5 для программирования?

Да, кодинг относится к её сильным сторонам: суббалл равен 87,3, а в паспорте Code Arena указаны rating 1555,6 и 20-е место. Для внедрения всё равно нужен тест на собственном репозитории.

Сколько стоит API Grok 4.5?

В паспорте указаны $2 за миллион входных и $6 за миллион выходных токенов. На дату среза официальный прайс предусматривал повышенные ставки для входного контекста от 200 000 токенов. Цены могут изменяться.

Насколько быстро отвечает модель?

В независимом срезе скорость составляет 54,2 выходного токена в секунду, а время до первого токена — 14,51 секунды. Для интерактивного интерфейса именно стартовая задержка может стать главным ограничением.

Знает ли Grok 4.5 последние новости?

Не автоматически. Официальная дата отсечения знаний — 1 февраля 2026 года; для более новых событий требуется подключённый поиск или переданные пользователем источники.

Можно ли отключить reasoning?

Нет. Документация разрешает выбирать уровни low, medium и high, но полностью отключить рассуждение у Grok 4.5 нельзя.

Источники

  • SpaceXAI Docs: Grok 4.5 — официальный идентификатор, контекст, модальности, функции и базовая цена.
  • Introducing Grok 4.5 — официальный анонс от 16 июля 2026 года и заявленные разработчиком сценарии.
  • SpaceXAI Release Notes — дата появления в API и параметры reasoning.
  • SpaceXAI Docs: Reasoning — режимы low, medium и high, а также невозможность отключения reasoning.
  • SpaceXAI API Pricing — тарифы короткого и длинного контекста на дату среза.
  • Artificial Analysis: LLM Leaderboard — независимые измерения Intelligence Index, цены, скорости и контекста, зафиксированные в паспорте.
  • LMArena Text Leaderboard — текстовый rating, место и число голосов.
  • LMArena Leaderboard — данные Code Arena, использованные в кодовом профиле.