Grok 4.20 beta1 стоит рассматривать как перспективную, но недостаточно документированную preview-модель. Её главный аргумент — LMArena text rating 1474,7 при 26 645 голосах и суббалл 99,7 за человеческие предпочтения. Главный риск — почти полное отсутствие сопоставимых данных о качестве, программировании, цене, скорости и контекстном окне именно этой версии.
Коротко
- Место в рейтинге COMRAD404: 54-е в редакции 2026 H2.
- COMRAD Score: 64,0 из 100. Это нормализованная редакционная оценка, а не процент качества.
- Лучший сигнал: human preference — 99,7 из 100 на основе сильного результата в LMArena Text.
- Главная неопределённость: нет Intelligence Index, Code Arena rating, цены, скорости, задержки первого токена и размера контекста.
- Статус: preview; модель нельзя автоматически считать production-ready.
- Доступ: закрытые веса, проприетарная лицензия, ограниченный уровень уверенности редакции.
Практический вывод прост: beta1 имеет смысл включить в короткий список для диалоговых интерфейсов, редактуры, генерации вариантов и задач, где важна субъективная убедительность ответа. Выбирать её единственной моделью для программного продукта, не проведя собственные измерения, преждевременно.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Модель | Grok 4.20 beta1 |
| Организация | SpaceXAI |
| Место | 54 |
| COMRAD Score | 64,0 / 100 |
| Статус | Preview |
| Reasoning-режим | Нет по паспорту этой конфигурации |
| Лицензия | Proprietary |
| Открытые веса | Нет |
| Уверенность оценки | Ограниченная |
| Срез данных | 31 августа 2026 года |
Название beta1 важно не сокращать до Grok 4.20 без оговорки. Официальная документация описывает семейство Grok 4.20 и более поздние именованные контрольные точки, однако отдельной полной технической карточки именно для grok-4.20-beta1 в исследованном наборе первичных материалов не найдено. Поэтому характеристики соседних конфигураций нельзя автоматически переносить на beta1.
Место в рейтинге
В рейтинге моделей ИИ COMRAD404 редакции 2026 H2 модель находится на 54-м месте. Итог 64,0 сформирован по методологии версии 1.0 из пяти суббаллов: качество имеет вес 40%, человеческие предпочтения — 30%, программирование — 15%, эффективность — 10%, доступность — 5%.
Позицию модели определяет контрастный профиль. Почти максимальный балл предпочтений пользователей сильно поднимает итог, но не может полностью компенсировать нейтральные значения по трём направлениям и слабую доступность. При заданных весах human preference даёт около 29,9 пункта итоговой оценки, тогда как quality приносит 20, coding — 7,5, efficiency — 5, а access — около 1,6.
Это не означает, что модель «правильно отвечает в 64% случаев». COMRAD Score — нормализованная редакционная оценка для сопоставления моделей с разным набором характеристик. Аналогично LMArena rating 1474,7 не является процентом точности: это статистический рейтинг, полученный из слепых попарных сравнений ответов.
Что показывают пять суббаллов
| Суббалл | Оценка | Как интерпретировать |
|---|---|---|
| Quality | 50,0 | В срезе нет Artificial Analysis Intelligence Index; значение не доказывает среднее объективное качество. |
| Human preference | 99,7 | Сильнейшая сторона профиля, опирающаяся на LMArena Text. |
| Coding | 50,0 | Нет LMArena Code rating и места; способности к программированию не подтверждены этой метрикой. |
| Efficiency | 50,0 | Нет сопоставимых данных о цене, генерации токенов в секунду и задержке первого токена. |
| Access | 32,5 | Закрытые веса, проприетарная лицензия и preview-статус ограничивают контроль и воспроизводимость. |
Три оценки по 50,0 не следует читать как три независимых доказательства «среднего уровня». В паспорте они соседствуют с отсутствующими исходными метриками. Поэтому наиболее надёжный вывод относится к пользовательским предпочтениям, а не к общей интеллектуальной мощности, кодингу или экономичности.
Сигнал LMArena: сильный, но не универсальный
В зафиксированном срезе Grok 4.20 beta1 получила LMArena text rating 1474,7, 25-е место в текстовой таблице и 26 645 голосов. Объём голосования делает сигнал содержательнее единичного обзора: ответы модели многократно сравнивали вслепую с ответами других систем.
Однако Arena измеряет относительное предпочтение людей в конкретном формате парного выбора. На результат могут влиять ясность, стиль, полнота, уверенность формулировок, соблюдение инструкции и субъективная полезность. Высокий rating не гарантирует фактическую безошибочность, устойчивость длинного агентного процесса, корректность кода или низкую стоимость эксплуатации.
Отсюда и необычный профиль: модель может нравиться пользователям заметно больше, чем позволяет заключить её неполное покрытие другими тестами. Для чат-продукта это важный плюс, а для автоматизации критических операций — только начальная гипотеза, которую ещё нужно проверять.
Возможности и сценарии
Официальная системная карточка семейства Grok 4.20 относит его к моделям общего назначения для ответов на вопросы, письма, перевода, творческой работы, программирования, исследования и мультимодального анализа текста и изображений. Документация семейства также указывает поддержку структурированного вывода и вызова функций. Это заявления разработчика о семействе, а не независимое подтверждение каждой функции в точной конфигурации beta1.
Где модель выглядит уместно
- Диалоговые продукты. Высокий human-preference score делает beta1 кандидатом для помощников, поддержки и интерфейсов с открытыми вопросами.
- Редактура и генерация вариантов. Её стоит проверить на переписывании, структурировании черновиков, создании заголовков и адаптации тона.
- Классификация с ручной проверкой. Возможны извлечение полей, тегирование обращений и подготовка JSON, если формат дополнительно валидируется кодом.
- Исследовательские прототипы. Модель можно включать в сравнительные стенды, где ответы оцениваются экспертами, а не сразу отправляются пользователю.
- Мультимодальные эксперименты. Семейство официально заявляет текстовые и графические входы, но доступность и поведение beta1 нужно подтверждать в используемом интерфейсе или API.
Где данных пока недостаточно
В паспорте отсутствует отдельный кодовый рейтинг, поэтому нельзя объявлять beta1 проверенным выбором для генерации патчей, миграций или автономного изменения репозитория. По той же причине нет оснований ранжировать её по сложному математическому рассуждению или длинным агентным цепочкам: reasoning для этой конфигурации отмечен как отсутствующий.
Цена и скорость
Данных о цене beta1 в срезе нет. Не указаны стоимость миллиона входных и выходных токенов, скорость вывода, time to first token и контекстное окно. Artificial Analysis также не покрывает эту конфигурацию в переданном паспорте.
На официальной странице семейства Grok 4.20 опубликованы параметры для именованного датированного reasoning-чекпойнта, но переносить их на beta1 некорректно. Алиасы могут маршрутизироваться на другую версию, а цена и производительность зависят от API-провайдера, региона, режима обработки, длины запроса, кэширования и приоритета обслуживания.
Для бюджета считайте стоимость по журналу реальных запросов: отдельно суммируйте входные, кэшированные и выходные токены, вызовы инструментов и повторные попытки. Для интерактивного продукта измеряйте не только токены в секунду, но и медиану и 95-й перцентиль задержки первого токена. До такого теста утверждать, что beta1 дешёвая или быстрая, нельзя.
Доступ, лицензия и воспроизводимость
Grok 4.20 beta1 — проприетарная модель без открытых весов. Это означает зависимость от интерфейса или инфраструктуры владельца, невозможность самостоятельно проверить веса и ограниченные возможности локального развёртывания. Open weights и открытое программное обеспечение — разные понятия; в данном случае веса вообще не опубликованы.
Preview-статус добавляет операционный риск. Поведение, доступность, лимиты и маршрутизация могут изменяться, а псевдоним модели не обязательно обеспечивает неизменный контрольный пункт. Для воспроизводимых тестов следует фиксировать точный идентификатор, дату, параметры генерации, системную инструкцию и сырой ответ.
Отдельный официальный репозиторий с весами или реализацией Grok 4.20 beta1 в ходе исследования не обнаружен. Доступный системный отчёт относится к семейству Grok 4.20 и полезен для понимания назначения и подхода к безопасности, но не заменяет техническую model card точной beta1-конфигурации.
Ограничения
- Неполное покрытие независимыми измерениями. Есть LMArena Text, но нет Artificial Analysis Intelligence Index и LMArena Code.
- Нет подтверждённой экономики. Цена, скорость, TTFT и контекст для точной версии отсутствуют.
- Preview вместо стабильного релиза. Модель не следует называть production-ready без эксплуатационной проверки.
- Закрытая поставка. Нельзя локально закрепить веса, провести полный аудит или независимо воспроизвести инференс.
- Неоднозначность семейства и версии. Официальные материалы в основном описывают Grok 4.20 в целом, а не отдельную beta1.
- Рейтинг предпочтений не равен истинности. Убедительный и удобный ответ всё ещё может содержать фактическую ошибку.
- Нет основания для критических автономных решений. Официальная системная карточка семейства требует человеческого контроля и экспертной валидации в медицине, праве, финансах и safety-critical системах.
Как проверить на своей задаче
Минимальный пилот должен сравнивать beta1 с вашей текущей системой на одинаковых данных. Для содержательного результата подготовьте не менее 100–200 примеров, включая обычные запросы, пограничные случаи и намеренно сложные формулировки.
- Определите критерии заранее. Например: фактическая точность, полнота, соблюдение формата, число исправлений, задержка и стоимость успешного ответа.
- Зафиксируйте конфигурацию. Запишите идентификатор модели, дату, temperature, лимит вывода, системный промпт, доступные инструменты и политику повторов.
- Проведите слепое сравнение. Уберите названия моделей и перемешайте ответы, чтобы бренд не влиял на оценку.
- Проверяйте факты отдельно. Эксперт или автоматический валидатор должен сверять числа, ссылки, цитаты и обязательные поля.
- Для кода запускайте тесты. Оценивайте не красоту объяснения, а сборку, статический анализ, тесты, безопасность и размер исправлений.
- Измерьте эксплуатацию. Соберите медиану, p95 и p99 задержки, долю ошибок API, расход токенов и стоимость одного принятого результата.
- Повторите тест во времени. Для preview-модели полезен контрольный прогон после изменения алиаса, провайдера или документации.
Критерий перехода в продукт лучше формулировать не как «модель набрала высокий рейтинг», а как измеримый порог: например, не хуже текущего решения по точности, заметно лучше по предпочтению редакторов и в пределах установленного бюджета на успешную операцию.
Кому подойдёт Grok 4.20 beta1
Модель наиболее интересна командам, которые оптимизируют субъективное качество диалога и могут позволить себе контролируемый эксперимент. Это могут быть редакционные инструменты, внутренние помощники, генераторы черновиков и чат-интерфейсы с обязательной проверкой результата.
Она хуже подходит организациям, которым уже на этапе выбора нужны фиксированная цена, измеренная задержка, стабильный идентификатор, локальное развёртывание, открытые веса или подтверждённые кодовые показатели. В таких условиях пробелы паспорта важнее высокого места в LMArena Text.
Итоговая редакционная оценка: Grok 4.20 beta1 показывает редкий по силе сигнал человеческого предпочтения, но её 54-е место логично отражает дефицит проверяемых эксплуатационных данных. Это кандидат для A/B-теста, а не выбор по умолчанию.
FAQ
Что означает COMRAD Score 64,0?
Это нормализованная редакционная оценка по шкале 0–100 с учётом пяти взвешенных направлений. Она не означает 64% правильных ответов и не является вероятностью успеха.
Почему human preference равен 99,7?
Суббалл отражает очень сильный результат модели в слепых попарных сравнениях LMArena Text. Сам LMArena rating 1474,7 является статистическим рейтингом, а не процентом качества.
Подходит ли Grok 4.20 beta1 для программирования?
Проверить её на коде можно, но в срезе нет LMArena Code rating и code rank. Поэтому надёжное преимущество в программировании по паспорту не подтверждено.
Сколько стоит использование модели?
Для точной beta1 данных о цене в паспорте нет. Тарифы других контрольных точек семейства нельзя автоматически переносить на неё; стоимость также зависит от провайдера и режима API.
Можно ли использовать модель в продакшене?
Статус модели — preview, поэтому считать её production-ready без собственного нагрузочного теста, контроля качества, мониторинга изменений и резервного маршрута нельзя.
Есть ли у Grok 4.20 beta1 открытые веса?
Нет. По паспорту это проприетарная модель с закрытыми весами, поэтому локальное развёртывание и независимый аудит весов недоступны.
Источники
- Официальная документация Grok 4.20 — описание семейства, интерфейсных возможностей и идентификаторов доступных конфигураций.
- Release Notes SpaceXAI — подтверждает появление Grok 4.20 и Grok 4.20 Multi-agent 10 марта 2026 года.
- Grok 4.20 System Card — официальный отчёт о назначении, модальностях, подготовке и оценке рисков семейства.
- LMArena Text Leaderboard — источник статистического рейтинга слепых попарных сравнений; числовой срез статьи взят только из переданного паспорта.
- Artificial Analysis LLM Leaderboard — проверяемый источник Intelligence Index и эксплуатационных метрик; для beta1 соответствующих данных в паспорте нет.
