Grok 4.20 Beta 0309 Reasoning — модель для задач, где важны рассуждение, работа с длинным контекстом и текстовый диалог, но не обязательно максимальная эффективность в программировании. В срезе COMRAD404 от 31 августа 2026 года она заняла 50-е место с COMRAD Score 64,2. Это не процент правильных ответов, а нормализованная редакционная оценка по пяти направлениям.
Главный контраст профиля — очень высокий суббалл human preference, равный 98,9, при заметно более скромном coding — 39,5. В слепых сравнениях LMArena модель получила текстовый рейтинг 1471,7 и 34-е место, тогда как в Code Arena её рейтинг составил 1373,6 и 80-е место. Поэтому перед нами не универсальный лидер для любого инженерного контура, а preview-модель с выраженным преимуществом в обычном текстовом взаимодействии.
Коротко
- Разработчик по паспорту: SpaceXAI.
- Режим: reasoning, то есть модель рассчитана на пошаговое внутреннее рассуждение перед ответом.
- Статус: preview. Это означает, что поведение, доступность, цена и интерфейс могут меняться.
- Контекст: 1 000 000 токенов по данным официальной страницы модели.
- Цена в паспорте: 1,25 доллара за миллион входных токенов и 2,50 доллара за миллион выходных.
- Скорость: данных об output tokens per second и time to first token в редакционном срезе нет.
- Лицензия: Proprietary; open weights отсутствуют.
Практический вывод простой: модель стоит рассматривать для исследовательских ассистентов, анализа документов, подготовки текстов и задач с большим объёмом входных данных. Для основного программного copilot-сервиса её следует сначала проверять на собственном наборе задач: общий результат в Code Arena заметно слабее текстового.
Место в рейтинге
В выпуске COMRAD404 2026 H2 Grok 4.20 Beta 0309 Reasoning расположилась на 50-й позиции. Итоговый COMRAD Score — 64,2 из 100. Оценка собрана с весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. При этом сами числа 50,0, 98,9, 39,5, 63,7 и 44,8 — именно нормализованные редакционные суббаллы по шкале 0–100, а не вероятности успеха и не проценты качества модели.
Место в общем списке объясняется не одной провальной характеристикой, а разрывом между направлениями. Модель получает сильную поддержку от human preference и приемлемые баллы за эффективность, но теряет позиции из-за quality, coding и access. Для читателя это означает, что впечатление от хорошего диалога может быть лучше, чем результат в специализированном инженерном тесте или удобство массового доступа.
Паспорт модели
| Параметр | Значение |
|---|---|
| Название | Grok 4.20 Beta 0309 Reasoning |
| Канонический идентификатор | grok-4-20-beta-0309 |
| Разработчик | SpaceXAI |
| Лицензия | Proprietary |
| Open weights | Нет |
| Режим рассуждения | Да |
| Статус | Preview |
| Контекст | 1 000 000 токенов |
| COMRAD Score | 64,2 из 100 |
| Позиция | 50 |
Официальная документация xAI для соответствующего идентификатора указывает текстовые и визуальные входы, текстовый выход, контекстное окно в 1 000 000 токенов, function calling, structured outputs и reasoning. На официальной странице модель также фигурирует под техническим именем grok-4.20-0309-reasoning, а строка grok-4.20-beta-0309-reasoning приведена как один из алиасов. В этой статье приоритет отдан названию из переданного паспорта, чтобы не смешивать канонический slug, API-идентификатор и алиасы.
Разбор пяти суббаллов
| Суббалл | Оценка | Что это означает |
|---|---|---|
| Quality | 50,0 | Средняя позиция по редакционной оценке общего качества; одного высокого пользовательского рейтинга недостаточно для лидерства. |
| Human preference | 98,9 | Очень сильный результат в пользовательских слепых текстовых сравнениях и наиболее заметное преимущество профиля. |
| Coding | 39,5 | Слабая сторона относительно остальных направлений; подтверждается 80-м местом в Code Arena. |
| Efficiency | 63,7 | Приемлемый баланс стоимости и практической применимости по редакционной шкале, но скорость в паспорте не измерена. |
| Access | 44,8 | Доступность и условия использования ограничивают итоговую привлекательность модели. |
Суббаллы нельзя читать как пять независимых тестовых процентов. Это редакционная нормализация разных типов данных. Например, human preference опирается на пользовательские попарные сравнения, а efficiency учитывает отдельные параметры стоимости и доступности. Поэтому значение 98,9 не означает, что 98,9% ответов идеальны, а 39,5 не означает, что модель правильно пишет только 39,5% кода.
Что говорят независимые измерения
В текстовой LMArena модель получила рейтинг 1471,7, заняла 34-е место и набрала 62 244 голоса. LMArena rating — это статистический результат слепых попарных сравнений, а не доля правильных ответов. Он показывает, как часто ответы модели предпочитали участники сравнения с учётом соперников и статистической модели рейтинга.
В Code Arena показатель составил 1373,6, место — 80. Такой разрыв между текстовой и кодовой аренами важнее, чем сама разница чисел: он указывает на разные практические профили. Для деловой переписки, структурирования материала, анализа требований или обсуждения решений текстовый результат выглядит убедительнее. Для генерации production-кода, исправления сложных регрессий и автономной работы с репозиторием нужен отдельный контроль качества.
Artificial Analysis Intelligence Index в переданном срезе отсутствует. Его нельзя восстановить по LMArena, по COMRAD Score или по заявленным возможностям API. Это также означает, что статья не делает выводов о месте модели в Artificial Analysis и не подменяет отсутствующую метрику оценкой «по аналогии».
Возможности и сценарии
Официальные материалы xAI описывают для Grok 4.20 reasoning, function calling и structured outputs. В сочетании с миллионным контекстом это делает модель интересной для задач, где ответ строится не из короткого запроса, а из большого рабочего набора материалов.
Анализ документов и исследовательская работа
Модель можно проверять на сводке длинных договоров, технических спецификаций, стенограмм, внутренних регламентов и нескольких связанных файлов. Полезный режим — сначала попросить построить карту источников и противоречий, затем сформировать выводы с указанием фрагментов, а в конце — вернуть структурированный JSON. Большое окно контекста помогает уменьшить необходимость дробить материал на множество независимых запросов, но само по себе не гарантирует безошибочное извлечение фактов.
Текстовые ассистенты
Высокий human preference делает модель кандидатом для диалоговых интерфейсов, редакторских черновиков, классификации обращений и подготовки вариантов ответа оператору. Здесь важно разделять приятный стиль и фактическую надёжность: пользовательское предпочтение обычно хорошо отражает ясность и уместность ответа, но не заменяет проверку фактов.
Инструментальные сценарии
Function calling позволяет соединять модель с внешними функциями: поиском по базе, CRM, каталогом товаров или внутренним API. Structured outputs удобны, когда результат должен пройти машинную валидацию. В production-контуре следует ограничить список допустимых инструментов, проверять аргументы схемой и записывать трассировку вызовов. Для финансовых, медицинских, юридических и других высокорисковых процессов нужна проверка человеком и профильная валидация.
Программирование
Модель не стоит автоматически выбирать как главный кодовый движок. Редакционный coding-суббалл равен 39,5, а Code Arena дала 80-е место. Это не запрещает использовать Grok 4.20 для объяснения ошибок, генерации тестовых идей, рефакторинга небольших участков или подготовки документации. Но для сложных изменений в репозитории необходимы компиляция, тесты, статический анализ, проверка зависимостей и ревью разработчика.
Цена и скорость
В паспорте указаны следующие базовые значения API: 1,25 доллара за 1 миллион входных токенов и 2,50 доллара за 1 миллион выходных токенов. Это разные единицы тарификации: вход оплачивается отдельно от выхода. При расчёте бюджета нужно учитывать длину промптов, объём ответа, повторную передачу контекста, reasoning-токены, если провайдер тарифицирует их отдельно, и возможные условия конкретного режима.
Официальная документация xAI также показывает отдельное ценообразование для длинного контекста начиная с порога 200 000 токенов и указывает возможность пакетной обработки со скидкой для соответствующих моделей. Эти условия зависят от актуальной таблицы провайдера и API-режима. Поэтому значения из паспорта следует воспринимать как зафиксированный срез, а перед запуском проекта сверять действующий прайс-лист и региональные условия.
Данные о output tokens per second и time to first token в редакционном паспорте отсутствуют. Нельзя честно назвать модель быстрой или медленной только по цене и заявленному контексту. Реальная задержка будет зависеть от длины запроса, включённого reasoning, нагрузки, региона, провайдера, очереди и настроек клиента. Если latency критична, её нужно измерять самостоятельно.
Ограничения
- Preview-статус. Модель не следует называть production-ready только на основании наличия документации или API-доступа. Идентификатор, поведение, лимиты и условия обслуживания могут измениться.
- Закрытая поставка. Лицензия указана как Proprietary, open weights отсутствуют. Пользователь не получает веса для локального развёртывания и не может обращаться с моделью как с открытым программным обеспечением.
- Неравномерный профиль. Сильный текстовый результат соседствует с низким кодовым суббаллом. Результаты общего чата нельзя переносить на инженерные задачи без проверки.
- Неполная измерительная картина. Нет Artificial Analysis Intelligence Index, output tokens per second и time to first token. Сравнение по этим направлениям ограничено.
- Стоимость не фиксирована навсегда. API-провайдер и режим могут менять тарифы, лимиты, правила длинного контекста и пакетные условия.
- Риск уверенных ошибок. Reasoning не означает автоматическую истинность. Критические утверждения, вычисления, ссылки, код и действия через инструменты должны проходить независимую проверку.
Кому подходит модель
Grok 4.20 Beta 0309 Reasoning имеет смысл тестировать командам, которым нужен закрытый API с большим контекстом, текстовым reasoning и инструментальными вызовами. Наиболее естественные кандидаты — внутренний исследовательский помощник, анализ больших пакетов документов, подготовка черновиков, извлечение полей в структурированный формат и диалоговый слой над корпоративной базой знаний.
Модель менее очевидно подходит как единственный компонент для code generation, автономного изменения репозитория или сценариев, где заранее требуется стабильный SLA по задержке. В таких случаях паспорт не даёт достаточных данных о скорости, а независимый кодовый рейтинг занимает 80-е место.
Как проверить на своей задаче
- Соберите репрезентативный набор. Возьмите не демонстрационные примеры, а 50–200 реальных запросов: простых, пограничных и заведомо сложных.
- Разделите тесты по классам. Отдельно измеряйте фактическую точность, следование формату, качество рассуждений, работу с длинным контекстом, вызов инструментов и код.
- Зафиксируйте параметры. Запишите идентификатор модели, дату, провайдера, регион, системный промпт, лимит ответа, температуру и параметры reasoning, если они доступны.
- Проверяйте не только финальный текст. Для JSON используйте строгую схему, для кода — сборку и тесты, для извлечения фактов — эталонную разметку, для инструментов — проверку аргументов и прав доступа.
- Измерьте цену. Посчитайте входные и выходные токены на одном и том же наборе, отдельно отметьте длинные запросы и повторно передаваемый контекст.
- Измерьте задержку. Зафиксируйте time to first token, полное время ответа и throughput на коротких и длинных запросах. В паспорте этих значений нет, поэтому без собственного замера обещать SLA нельзя.
- Проверьте устойчивость. Повторите каждый запрос несколько раз и сравните разброс ответов. Для preview-модели полезно повторять тесты после обновления идентификатора или документации.
Минимальный критерий допуска в рабочий контур — не красивый единичный ответ, а воспроизводимое выполнение бизнес-метрики при приемлемой стоимости и задержке. Для рискованных действий добавьте ручное подтверждение и журналирование.
FAQ
Что означает 50-е место в рейтинге COMRAD404?
Это позиция Grok 4.20 Beta 0309 Reasoning в редакционном выпуске 2026 H2 на срез 31 августа 2026 года. Она рассчитана по COMRAD Score 64,2 и пяти нормализованным суббаллам, а не по одному тесту.
COMRAD Score 64,2 — это 64,2% правильных ответов?
Нет. COMRAD Score и суббаллы — шкала редакционной нормализации от 0 до 100. Это не процент качества, точности или успешных ответов.
Насколько хорошо модель программирует?
Паспорт показывает coding-суббалл 39,5, рейтинг Code Arena 1373,6 и 80-е место. Это сигнал тестировать модель особенно тщательно; для кода обязательны сборка, автоматические тесты, анализ безопасности и ревью.
Какой у модели контекст?
В редакционном срезе указано 1 000 000 токенов. Официальная документация xAI также указывает миллионное окно для соответствующей версии. Реальная доступная длина запроса зависит от API-режима и действующих условий.
Сколько стоит Grok 4.20 Beta 0309 Reasoning?
В паспорте указаны 1,25 доллара за миллион входных токенов и 2,50 доллара за миллион выходных токенов. Цена может зависеть от провайдера, режима и порога длинного контекста, поэтому перед запуском нужно сверять актуальный прайс-лист.
Известна ли скорость ответа?
Нет. Значения output tokens per second и time to first token в паспорте отсутствуют. Скорость следует измерить на собственном API-маршруте с учётом размера запроса и нагрузки.
Можно ли запустить модель локально?
По паспорту open weights отсутствуют, а лицензия указана как Proprietary. Поэтому модель следует рассматривать как закрытый сервис, а не как пакет весов для локального развёртывания.
Источники
Фактическая часть статьи разделяет данные паспорта COMRAD404, независимые рейтинги и официальные заявления разработчика. Официальная документация подтверждает возможности API, техническое имя, алиасы, контекст и цены; системная карточка описывает назначение и ограничения семейства Grok 4.20. Ниже приведены страницы, использованные для проверки.
- Страница модели Grok 4.20 Beta 0309 Reasoning — официальное имя, алиасы, контекст, возможности и базовая цена.
- Grok 4.20 System Card — назначение модели, поддерживаемые модальности, ограничения применения и описание разработки семейства.
- API Pricing — актуальная структура тарифов xAI, включая порог длинного контекста и пакетные условия.
- LMArena Text Leaderboard — текстовый рейтинг и пользовательские попарные сравнения.
- LMArena Leaderboard — результаты Code Arena, использованные в кодовом суббалле.
- Artificial Analysis: LLM Leaderboard — источник для Intelligence Index и связанных параметров; значения для этой модели в переданном срезе отсутствуют.
Срез рейтинга и паспорта: 31 августа 2026 года. Цена, доступность, алиасы, лимиты и поведение preview-модели могут измениться после этой даты.
