Grok 4.3 — модель с неоднородным профилем. В рейтинге COMRAD404 за вторую половину 2026 года она занимает 39-е место с COMRAD Score 65,9. Это не универсальный лидер по всем направлениям: главный аргумент в пользу модели — высокий показатель человеческого предпочтения, а главный повод для осторожности — слабый кодовый суббалл и заметно более низкое место в Code Arena.
Модель доступна через API как закрытый продукт SpaceXAI. У неё есть режим рассуждений, поддержка текстовых и графических входов, вызов функций, структурированные ответы и контекст до 1 000 000 токенов. По паспорту рейтинга цена составляет $1,25 за миллион входных токенов и $2,50 за миллион выходных, но эти значения следует воспринимать как зафиксированный срез, а не как бессрочное обещание провайдера.
Практический вывод прост: Grok 4.3 имеет смысл проверять для диалоговых интерфейсов, редакторских и аналитических задач, обработки длинных документов и инструментальных сценариев. Для разработки, где цена ошибки в коде высока, модель нельзя выбирать только по общему баллу или скорости генерации — необходим отдельный тест на собственном репозитории.
Коротко
- Место в COMRAD404: 39-е.
- COMRAD Score: 65,9 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
- Лучшее измеренное свойство: human preference — 90,9 из 100.
- Самое слабое свойство: coding — 38,1 из 100.
- Text Arena: рейтинг LMArena 1442,4, 77-е место, 63 272 голоса.
- Code Arena: рейтинг LMArena 1356,0, 90-е место.
- Цена в паспорте: $1,25 за 1 млн входных токенов и $2,50 за 1 млн выходных токенов.
- Скорость: 162,4 выходного токена в секунду; time to first token — 9,71 секунды.
- Контекст: 1 000 000 токенов.
- Лицензия: Proprietary; открытых весов нет.
Срез фактов для этой статьи зафиксирован на 31 августа 2026 года. Динамические показатели API, в том числе цена, скорость и доступность кластеров, могут изменяться в зависимости от провайдера, региона и режима обработки.
Паспорт модели
| Параметр | Значение |
|---|---|
| Модель | Grok 4.3 |
| Канонический идентификатор | grok-4.3 |
| Организация в паспорте | SpaceXAI |
| Лицензия | Proprietary |
| Открытые веса | Нет |
| Рассуждения | Да |
| Preview | Нет |
| Контекст | 1 000 000 токенов |
| Входная цена | $1,25 за 1 млн токенов |
| Выходная цена | $2,50 за 1 млн токенов |
| Выходная скорость | 162,4 токена/с |
| Time to first token | 9,71 с |
Официальная страница модели указывает для grok-4.3 текстовые и графические входы, контекстное окно 1 000 000 токенов, вызов функций, структурированные ответы и настраиваемый уровень рассуждений. В документации также указан псевдоним grok-4.3-latest. Эти сведения относятся к API-документации разработчика, тогда как баллы COMRAD404 и значения LMArena — независимые измерения или редакционная агрегация.
Место в рейтинге
39-я позиция в COMRAD404 означает, что Grok 4.3 находится в верхней части расширенного списка, но не относится к группе моделей с наиболее сбалансированным профилем. Итоговый COMRAD Score 65,9 сформирован пятью нормализованными редакционными суббаллами с весами: качество — 40%, человеческое предпочтение — 30%, программирование — 15%, эффективность — 10%, доступ — 5%.
Важна не только итоговая цифра, но и её структура. Human preference равен 90,9, тогда как coding — 38,1. Разрыв в 52,8 пункта показывает, что модель заметно лучше воспринимается в открытых пользовательских взаимодействиях, чем выглядит в кодовой составляющей рейтинга. Quality на уровне 56,4 также не даёт оснований трактовать Grok 4.3 как безусловный выбор для задач, где требуется максимальная фактическая точность.
Суббалл efficiency равен 66,7. Он поддерживается сочетанием относительно умеренной цены, высокой скорости выдачи и большого контекстного окна, но time to first token в 9,71 секунды напоминает, что высокая скорость последующей генерации не равна мгновенному началу ответа. Access — 74,8: модель достаточно доступна в рамках оцениваемого API-сценария, однако закрытая лицензия и отсутствие открытых весов ограничивают варианты самостоятельного развёртывания.
Для дополнительного контекста паспорт фиксирует результаты LMArena: 1442,4 в Text Arena и 1356,0 в Code Arena. Рейтинг LMArena — это статистическая оценка по слепым попарным сравнениям, а не процент успешных ответов. Число 1442,4 нельзя читать как «1442,4 правильного ответа из 100», так же как место 77 не означает процентиль без дополнительных расчётов.
Разбор пяти суббаллов
| Суббалл | Оценка | Что означает для выбора |
|---|---|---|
| Quality | 56,4 | Общий уровень качества в редакционной нормализации; не процент точности. |
| Human preference | 90,9 | Сильная сторона профиля: модель часто выигрывает по воспринимаемому качеству ответа в пользовательском сравнении. |
| Coding | 38,1 | Главная зона риска; результаты Code Arena требуют проверки на реальном коде. |
| Efficiency | 66,7 | Хорошее сочетание цены, скорости и контекста в зафиксированном режиме. |
| Access | 74,8 | Приемлемая доступность API, но без открытых весов и без возможности свободного локального запуска. |
Низкий coding-суббалл не доказывает, что Grok 4.3 не умеет программировать. Он говорит о другом: в общей редакционной модели оценки кодовый профиль заметно слабее диалогового. Для простых скриптов, объяснения ошибок и генерации шаблонов этого может быть достаточно. Для миграций, больших рефакторингов, тестовой инфраструктуры и изменений с высокой стоимостью дефекта нужны собственные измерения.
Возможности и сценарии
Диалоговые и редакторские задачи
Высокий human preference делает Grok 4.3 кандидатом для интерфейсов, в которых пользователь оценивает не только фактологию, но и полезность формулировки: черновики, структурирование заметок, преобразование текста, ответы на уточняющие вопросы, подготовку вариантов письма или краткого отчёта. При этом редактору следует сохранять проверку фактов: показатель человеческого предпочтения не заменяет независимую оценку достоверности.
Длинные документы
Контекст в 1 000 000 токенов подходит для анализа крупных коллекций материалов, последовательного разбора документации, сопоставления версий требований и многошагового диалога с большим объёмом исходных данных. Большое окно не гарантирует одинаковую точность на любой позиции контекста. В рабочем процессе полезно разбивать документы на логические блоки, просить модель ссылаться на фрагменты и отдельно проверять выводы по первоисточнику.
Инструментальные и агентные цепочки
Официальная документация заявляет function calling и structured outputs. Это позволяет строить связку, в которой модель выбирает функцию, передаёт аргументы по схеме, получает результат внешней системы и формирует следующий шаг. Такой режим удобен для поиска по внутренним данным, маршрутизации заявок, подготовки JSON-объектов и интеграции с прикладными сервисами.
Практическое ограничение здесь — не наличие функции в документации, а контроль исполнения. В production-сценарии необходимо проверять схему аргументов, разрешённые действия, повторные вызовы, тайм-ауты, стоимость цепочки и поведение при частичном отказе инструмента.
Мультимодальный ввод
В паспорте и официальной карточке указана поддержка изображений на входе при текстовом результате. Это делает модель пригодной для разбора скриншотов, таблиц, схем, интерфейсных макетов и фотографий документов, если конкретный API-режим и формат файла доступны выбранному провайдеру. Данных о специализированной точности на медицинских, инженерных или юридических изображениях в переданном срезе нет, поэтому такие применения нельзя считать подтверждёнными рейтингом.
Качество рассуждений и программирования
Grok 4.3 отмечен в паспорте как reasoning-модель. Официальная документация дополнительно описывает configurable reasoning с уровнями none, low, medium и high. Это полезно для настройки компромисса между глубиной рассуждений, задержкой и расходом токенов: простому классификатору не обязательно выделять тот же режим, что и задаче с несколькими зависимыми условиями.
Однако наличие режима рассуждений не означает автоматической надёжности. В задачах на расчёты и логические ограничения следует требовать промежуточную структуру решения, проверять арифметику отдельным кодом и тестировать устойчивость к изменению формулировки.
Кодовый профиль выглядит осторожнее. В паспорте для Code Arena указаны рейтинг 1356,0 и 90-е место. Это независимый сигнал о сравнительной позиции в слепых пользовательских сравнениях, но не полный аудит программирования. LMArena не отвечает на вопросы о качестве сборки, работе с конкретным стеком, безопасности зависимостей, покрытии тестами или способности удерживать архитектурные ограничения проекта.
Цена и скорость
В зафиксированном паспорте Grok 4.3 стоит $1,25 за 1 млн входных токенов и $2,50 за 1 млн выходных токенов. При равном объёме входа и выхода цена зависит от их соотношения: длинный контекст с коротким ответом будет расходовать бюджет иначе, чем короткий запрос с большим результатом.
Официальная карточка модели подтверждает базовые значения $1,25 за 1 млн входных токенов и $2,50 за 1 млн выходных, а также отдельно указывает более низкую стоимость кэшированных входных токенов и повышенную тарификацию для запросов свыше 200 000 токенов. В COMRAD-паспорте зафиксированы только основные input/output-ставки, поэтому дополнительные тарифные режимы не следует смешивать с редакционными числами без отдельного расчёта.
Измеренная в паспорте скорость выдачи — 162,4 выходного токена в секунду. Это показатель генерации после начала ответа, а не время полного выполнения запроса. Time to first token составляет 9,71 секунды, поэтому пользователь может достаточно долго ждать первый фрагмент, а затем получить остальной текст быстро.
Показатели Artificial Analysis в паспорте включают Intelligence Index 36,9 с пометкой estimated. Это собственная шкала Artificial Analysis, а не проценты и не тот же показатель, что COMRAD Score или LMArena rating. Любое сравнение стоимости и скорости нужно проводить в одинаковом API-провайдере, регионе, режиме рассуждений, длине контекста и нагрузке.
Ограничения
- Закрытая поставка. Лицензия указана как Proprietary, открытых весов нет. Локальное развёртывание и самостоятельный аудит параметров модели не предусмотрены паспортом.
- Неравномерный профиль. Human preference значительно выше coding, поэтому один общий балл скрывает разницу между диалоговыми и программными задачами.
- Задержка первого токена. 9,71 секунды может быть заметной в интерактивном интерфейсе, даже если последующая скорость высокая.
- Динамическая экономика API. Цена, лимиты, доступные кластеры и скорость могут меняться. Официальная карточка также различает обычный, кэшированный и увеличенный по контексту режимы.
- Нет подтверждённой архитектурной информации. В переданном срезе нет данных о числе параметров, типе архитектуры, обучающем наборе, дате релиза и полноценной model card.
- Нет отдельной даты релиза Grok 4.3. В найденных официальных release notes присутствуют записи о Grok 4, Grok 4.20, Grok 4.5 и более новых версиях, но отдельная первичная запись о выпуске именно Grok 4.3 в доступном срезе не найдена. Дату нельзя восстанавливать по материалам о другом поколении.
- Рейтинги не заменяют приёмку. Blind pairwise comparison показывает статистическую сравнительную позицию, но не гарантирует нужный уровень качества на конкретных данных компании.
Кому стоит выбрать Grok 4.3
Модель разумно рассматривать командам, которым нужен API с большим контекстом, инструментальными вызовами, структурированным выводом и возможностью включать рассуждения по уровню сложности. Она особенно уместна там, где важны удобство диалога, обработка больших текстовых массивов и быстрое формирование длинного ответа после начальной задержки.
Grok 4.3 менее очевидный выбор для проекта, в котором кодогенерация является главным продуктовым сценарием. Низкий coding-суббалл не запрещает использовать модель в IDE или агенте, но повышает требования к тестам, ревью и ограничению прав инструментов. Также модель не подходит организациям, которым нужны открытые веса, локальная обработка или лицензия, допускающая свободную модификацию и распространение.
Как проверить на своей задаче
- Соберите собственный набор. Возьмите 30–100 обезличенных запросов из реального процесса: документы, классификация, ответы клиентам, извлечение полей, кодовые изменения.
- Разделите тест по типам. Не смешивайте свободный диалог, строгий JSON, работу с длинным контекстом, вызов инструментов и программирование в одну среднюю оценку.
- Зафиксируйте режим. Запишите модель, уровень reasoning, регион, провайдера, параметры генерации, размер входа и лимит ответа. Иначе сравнение цены и задержки будет нестабильным.
- Проверяйте не только ответ. Для структурированного вывода валидируйте JSON-схему; для кода запускайте тесты, линтер и сборку; для извлечения данных сверяйте поля с эталоном.
- Измеряйте задержку по этапам. Снимайте time to first token, скорость выдачи, полное время и число повторных запросов. Один показатель токенов в секунду не описывает пользовательский опыт.
- Считайте стоимость цепочки. Учитывайте повторные попытки, системные инструкции, результаты инструментов, кэширование и длинные префиксы. Сравнивайте не цену одного вызова, а стоимость завершённого бизнес-сценария.
- Проверьте отказоустойчивость. Добавьте пустые поля, противоречивые инструкции, слишком длинные документы, недоступный инструмент и вредоносные фрагменты в пользовательском вводе.
- Сделайте слепую оценку. Пусть несколько специалистов сравнят ответы без знания названия модели. Это ближе к смыслу human preference, но всё равно не заменяет объективные тесты.
Минимальный критерий допуска для production должен включать порог фактической точности, долю валидных структурированных ответов, процент успешно прошедших тесты изменений кода, максимальную задержку и бюджет на завершённый сценарий. Если Grok 4.3 выигрывает по стоимости и удобству, но не проходит по безопасности или воспроизводимости, общий COMRAD Score не меняет решения.
Что известно из официальных материалов
Официальная карточка grok-4.3 описывает модель как быструю и надёжную модель с сильными возможностями вызова инструментов и следования инструкциям. В ней перечислены текстовые и графические входы, функция вызова инструментов, структурированные ответы и регулируемое рассуждение. Документация также показывает базовые цены, контекст в 1 000 000 токенов, псевдоним grok-4.3-latest и API-лимиты для отображённого региона.
Это официальные заявления разработчика о доступных возможностях API. Они не являются независимым подтверждением качества на всех типах задач. Независимые числа в этой статье взяты из паспорта COMRAD404, где отмечены покрытия Artificial Analysis и LMArena. Отдельной открытой model card или репозитория весов для точной версии Grok 4.3 в использованном исследовании не найдено.
FAQ
Какое место занимает Grok 4.3?
В рейтинге COMRAD404, редакция 2026 H2, модель занимает 39-е место с COMRAD Score 65,9 из 100.
Что у Grok 4.3 получается лучше всего?
Сильнейшая часть профиля — human preference с оценкой 90,9 из 100. Это указывает на высокое воспринимаемое качество ответов в пользовательских сравнениях, но не означает 90,9% точности.
Подходит ли Grok 4.3 для программирования?
Использовать модель для кода можно, однако паспорт показывает coding-суббалл 38,1, рейтинг Code Arena 1356,0 и 90-е место. Для серьёзной разработки обязательны тесты на собственном репозитории и ручное ревью.
Сколько стоит Grok 4.3?
В зафиксированном срезе цена составляет $1,25 за 1 млн входных токенов и $2,50 за 1 млн выходных токенов. Фактическая сумма зависит от провайдера, режима, кэширования, региона и объёма контекста.
Какой у модели контекст?
В паспорте и официальной карточке указан контекст до 1 000 000 токенов. Большое окно не гарантирует одинаковую точность на каждом фрагменте длинного документа, поэтому результаты нужно проверять по источникам.
Есть ли у Grok 4.3 открытые веса?
Нет. В паспорте указаны закрытая лицензия Proprietary и отсутствие open weights. Это API-модель, а не пакет для свободного локального запуска.
Известна ли точная дата релиза Grok 4.3?
В использованном исследовании точная дата отдельного релиза Grok 4.3 не подтверждена. В официальных release notes найдены записи о других версиях семейства, но переносить их даты на Grok 4.3 нельзя.
Источники
Паспортные значения рейтинга, суббаллов и среза метрик приведены по данным редакции COMRAD404. Общий рейтинг COMRAD404 содержит методологический контекст и место модели в таблице.
- Страница модели Grok 4.3 в документации SpaceXAI — название, идентификатор, возможности API, контекст и официальные базовые цены.
- Официальные release notes SpaceXAI — проверка первичных упоминаний релизов и фиксация отсутствия отдельной записи о выпуске Grok 4.3 в доступном срезе.
- Artificial Analysis: LLM Leaderboard — источник покрытия Intelligence Index, стоимости, скорости, контекста и API-функций в паспорте.
- LMArena Text Leaderboard — источник текстового рейтинга, места и числа пользовательских голосов в паспорте.
- LMArena Leaderboard — источник результатов Code Arena, использованных для кодового суббалла.
Редакционная оговорка: все рейтинговые числа относятся к срезу на 31 августа 2026 года. Изменение API-тарифов, маршрутизации, доступных версий или состава лидербордов не делает этот исторический срез недействительным, но может изменить практическую оценку модели при новом тестировании.
