Запись архива

Grok 4.20 Multi Agent Beta 0309: обзор модели

Grok 4.20 Multi Agent Beta 0309 выделяется почти максимальной оценкой пользовательских предпочтений, но её итоговый профиль ослабляют пробелы в независимых тестах качества, кода и скорости, а также статус preview.

Профиль Grok 4.20 Multi Agent Beta 0309 с COMRAD Score 65,7 и пятью суббаллами

Grok 4.20 Multi Agent Beta 0309 стоит рассматривать прежде всего как специализированный API-инструмент для исследовательских задач, где несколько агентов параллельно собирают аргументы и один ведущий агент сводит их в ответ. Модель получила высокий сигнал человеческих предпочтений, но данных недостаточно, чтобы столь же уверенно судить о её объективном качестве, программировании и задержках. Поэтому 40-е место и COMRAD Score 65,7 описывают не слабую модель, а неровно подтверждённый профиль с ограниченной уверенностью.

Коротко

  • Главная сильная сторона: human preference 98,6 — почти максимальная нормализованная редакционная оценка по сигналу слепых пользовательских сравнений.
  • Главная неопределённость: в срезе нет Artificial Analysis Intelligence Index, отдельного LMArena Code rating и измерений скорости.
  • Основной сценарий: сложное исследование с несколькими направлениями поиска, проверкой альтернатив и итоговым синтезом.
  • Цена из паспорта: $1,25 за миллион входных и $2,50 за миллион выходных токенов. Фактический счёт может быть выше из-за работы субагентов и инструментов.
  • Контекст: 1 000 000 токенов, однако размер окна сам по себе не гарантирует точного использования всего документа.
  • Статус: preview по редакционному паспорту; уверенность в итоговой оценке ограниченная.

Паспорт модели

Параметр Значение в срезе
Модель Grok 4.20 Multi Agent Beta 0309
Организация SpaceXAI
Место COMRAD404 40
COMRAD Score 65,7 из 100
Редакция рейтинга 2026 H2, методология 1.0
Лицензия Проприетарная
Открытые веса Нет
Статус Preview
Reasoning в паспорте Нет
Контекст 1 000 000 токенов
Цена ввода / вывода $1,25 / $2,50 за 1 млн токенов
Уверенность оценки Ограниченная

COMRAD Score и суббаллы — нормализованные редакционные оценки по шкале 0–100, а не проценты правильных ответов. LMArena rating 1470,5 также не является процентом качества: это статистический рейтинг, рассчитанный по результатам слепых попарных сравнений.

Место в рейтинге

В редакции рейтинга ИИ COMRAD404 за второе полугодие 2026 года модель занимает 40-е место с результатом 65,7. Итог складывается из пяти компонентов: quality с весом 40%, human preference — 30%, coding — 15%, efficiency — 10% и access — 5%.

На итог сильнее всего работает human preference: 98,6 при весе 30% даёт примерно 29,6 пункта. Quality 50,0 добавляет 20 пунктов, coding 50,0 — 7,5, efficiency 63,7 — около 6,4, access 44,8 — около 2,2. После округления сумма соответствует COMRAD Score 65,7.

Такой состав важнее самого номера позиции. Почти максимальная пользовательская оценка соседствует с нейтральными quality и coding, за которыми нет профильных сырых метрик в переданном срезе. Это означает, что модель убедительно выглядит в сравнении ответов, но её способность стабильно решать формализованные задачи подтверждена слабее.

Разбор пяти суббаллов

Суббалл Оценка Как читать
Quality 50,0 В срезе нет Artificial Analysis Intelligence Index. Оценку нельзя принимать за результат независимого комплексного теста.
Human preference 98,6 Сильнейшая сторона профиля, опирающаяся на Text Arena rating 1470,5, 35-е место и 60 845 голосов.
Coding 50,0 Отдельные LMArena Code rating и code rank отсутствуют; уверенного вывода о программировании нет.
Efficiency 63,7 Умеренно сильная редакционная оценка на фоне цены и большого контекста, но без измеренной скорости и TTFT.
Access 44,8 Доступ ограничивают проприетарность, закрытые веса и preview-статус.

Quality 50,0 и coding 50,0 выглядят как середина шкалы, но не должны создавать ложную точность. В паспорте отсутствуют измерения, которые позволили бы связать эти числа с конкретной долей решённых задач. Для выбора модели это сигнал обязательно провести собственные тесты, а не считать пятидесятибалльные значения доказанной средней производительностью.

Что означает высокий результат LMArena

В текстовой LMArena модель получила rating 1470,5, 35-е место и 60 845 голосов. Arena формирует рейтинг из слепых сравнений: пользователю показывают ответы двух скрытых моделей, после чего его выбор входит в статистическую систему Bradley–Terry. Поэтому рейтинг отражает относительное предпочтение ответов участниками, а не точность на фиксированном экзамене. ([arena.ai](https://arena.ai/faq?utm_source=openai))

Высокий human preference может быть связан с полнотой, ясной структурой, убедительным синтезом и хорошим соответствием ожиданиям читателя. Но приятный или подробный ответ способен содержать фактическую ошибку. Для юридических, медицинских, финансовых и иных задач с высокой ценой ошибки каждое существенное утверждение следует проверять по первичным источникам.

Как устроен multi-agent режим

По официальной документации запрос обрабатывают несколько агентов, которые параллельно исследуют вопрос, а назначенный ведущий агент собирает итоговый ответ. Доступны конфигурации с 4 и 16 агентами: первая предназначена для более сфокусированных запросов, вторая — для многоаспектного исследования, но требует больше токенов и времени. ([docs.x.ai](https://docs.x.ai/developers/model-capabilities/text/multi-agent?st_source=ai_mode))

Это не означает, что пользователь получает независимый отчёт каждого участника. По умолчанию наружу передаются вызовы инструментов и ответ ведущего агента; внутреннее состояние субагентов не раскрывается как обычный читаемый журнал. Следовательно, многоагентность повышает разнообразие поиска, но не заменяет прозрачную трассировку доказательств. ([docs.x.ai](https://docs.x.ai/developers/model-capabilities/text/multi-agent?st_source=ai_mode))

В паспорте флаг reasoning установлен в значение «нет». Официальная документация при этом использует параметр reasoning.effort, но для этой модели он управляет количеством агентов, а не глубиной отдельного reasoning-процесса. В рамках методологии COMRAD404 многоагентную оркестрацию поэтому не следует автоматически приравнивать к подтверждённому самостоятельному reasoning-режиму.

Возможности и сценарии

Наиболее логичные задачи для модели — те, которые можно разделить на несколько исследовательских ветвей и затем свести в общий документ:

  • сравнение технических подходов по заранее заданным критериям;
  • подготовка обзора рынка, нормативной темы или научного направления с источниками;
  • поиск противоречий между несколькими документами;
  • сбор аргументов «за» и «против» перед продуктовым решением;
  • анализ длинного набора материалов с построением карты рисков;
  • создание первого черновика due diligence, который затем проверяет специалист;
  • исследование гипотез, когда полезно поручить агентам разные точки зрения.

Официальная страница указывает текстовый и графический ввод, текстовый вывод, function calling и structured outputs. Однако паспорт не содержит отдельной оценки качества работы с изображениями, поэтому пригодность для визуального анализа нужно проверять самостоятельно. ([docs.x.ai](https://docs.x.ai/developers/models/grok-4.20-multi-agent-0309))

Для короткого письма, простой классификации или массовой обработки однотипных записей многоагентный режим может оказаться избыточным. Его ценность появляется не от самого числа агентов, а когда задачу действительно можно декомпозировать и проверить результат нескольких исследовательских маршрутов.

Интеграция и рабочий процесс

Официальная документация рекомендует xAI SDK либо Responses API. Multi-agent вариант не поддерживает Chat Completions API, клиентские и произвольные custom tools, а также параметр max_tokens. При этом заявлена работа со встроенными серверными инструментами, включая web search, X search, code execution, collections search и удалённые MCP-инструменты. ([docs.x.ai](https://docs.x.ai/developers/model-capabilities/text/multi-agent?st_source=ai_mode))

Для воспроизводимой интеграции лучше указывать закреплённый идентификатор grok-4.20-multi-agent-0309, а не псевдоним с окончанием latest. В официальном changelog SDK указано, что 11 марта 2026 года имена вариантов были переведены из experimental beta в beta, а 19 марта — из beta в схему наименования GA. Beta-идентификатор остался среди алиасов официальной страницы, но точное имя из паспорта относится к переходной схеме. ([github.com](https://github.com/xai-org/xai-sdk-python/blob/main/CHANGELOG.md))

Отдельного публичного model card с описанием архитектуры, размера, состава обучающих данных и процедуры safety-evaluation для точной версии в ходе исследования не найдено. Поэтому эти характеристики в профиль не добавляются. Официальный репозиторий SDK подтверждает историю API-имён, но не публикацию весов модели.

Цена и скорость

В паспортном срезе указаны $1,25 за миллион входных токенов и $2,50 за миллион выходных. Например, один запрос с 100 000 входных и 20 000 выходных токенов стоил бы $0,175 при прямом расчёте базовых токенов: $0,125 за ввод и $0,05 за вывод.

Для multi-agent режима такой пример нельзя считать прогнозом окончательного счёта. Официальная документация указывает, что оплачиваются токены ведущего агента и субагентов, а вызовы серверных инструментов тарифицируются отдельно. Конфигурация с 16 агентами расходует заметно больше токенов, чем вариант с четырьмя. ([docs.x.ai](https://docs.x.ai/developers/model-capabilities/text/multi-agent?st_source=ai_mode))

Скорость вывода в токенах в секунду и time to first token в переданном срезе отсутствуют. Следовательно, efficiency 63,7 нельзя переводить в обещание низкой задержки. Время ответа будет зависеть от числа агентов, объёма контекста, инструментов, региона, загрузки API и провайдера. Цена также может измениться после даты среза, поэтому перед запуском нагрузки следует сверить актуальный тариф и выставить бюджетные ограничения.

Контекст в миллион токенов

Контекстное окно 1 000 000 токенов позволяет передавать большие подборки документов, журналы, спецификации или длительную историю исследования. Официальная карточка подтверждает этот предел для модели. ([docs.x.ai](https://docs.x.ai/developers/models/grok-4.20-multi-agent-0309))

Однако максимальный размер окна не равен гарантии равномерного внимания ко всем фрагментам. Практический тест должен проверять извлечение фактов из начала, середины и конца корпуса, распознавание противоречий, соблюдение приоритетов источников и способность указывать, на каком документе основан вывод. Для производственной системы полезно предварительно очищать документы, удалять дубли и присваивать фрагментам устойчивые идентификаторы.

Ограничения

  • Неполное независимое покрытие. Artificial Analysis Intelligence Index для модели в срезе отсутствует; это не нулевой результат, а отсутствие данных.
  • Нет code-рейтинга. LMArena Code rating и code rank не представлены, поэтому coding 50,0 нельзя считать измеренной способностью писать и исправлять программы.
  • Нет данных о задержках. Output tokens per second и TTFT отсутствуют.
  • Preview-статус. Паспорт не рассматривает точную beta-версию как production-ready. Поведение, доступность и идентификаторы могут изменяться.
  • Закрытые веса. Модель проприетарная и не является open weights или открытым программным обеспечением.
  • Стоимость оркестрации. Несколько агентов и встроенные инструменты увеличивают расход относительно простого одиночного ответа.
  • Ограниченная наблюдаемость. Итог синтезирует ведущий агент, а полное внутреннее обсуждение субагентов по умолчанию не показывается.
  • API-ограничения. Для варианта заявлены ограничения по Chat Completions, custom tools и max_tokens.

Кому модель подойдёт

Grok 4.20 Multi Agent Beta 0309 имеет смысл включить в шорт-лист командам, которым нужен исследовательский агент через API и которые готовы контролировать источники, расходы и время ответа. Особенно уместен пилот для аналитиков, редакций, продуктовых исследователей, специалистов по конкурентной разведке и разработчиков систем обработки больших наборов документов.

Модель хуже подходит как единственный компонент критически важного конвейера, если команде необходимы открытые веса, локальный запуск, предсказуемая минимальная задержка или подтверждённое качество программирования. При ограниченном бюджете сначала стоит проверить, даёт ли режим из четырёх агентов измеримый выигрыш по сравнению с более простым процессом.

Как проверить на своей задаче

  1. Соберите 30–100 реальных примеров. Не ограничивайтесь демонстрационными вопросами; включите типичные, сложные и намеренно неоднозначные случаи.
  2. Зафиксируйте версию. Используйте grok-4.20-multi-agent-0309, сохраните дату, параметры, список инструментов и число агентов.
  3. Создайте эталон. Для каждого примера определите обязательные факты, допустимые выводы, запрещённые допущения и требования к ссылкам.
  4. Сравните 4 и 16 агентов. Измеряйте не только качество, но и полный расход токенов, стоимость, задержку и долю неудачных запросов.
  5. Проверьте источники. Отдельно считайте вымышленные ссылки, неверную атрибуцию, устаревшие данные и выводы, не подтверждённые найденными материалами.
  6. Протестируйте длинный контекст. Разместите проверяемые факты в разных частях корпуса и добавьте похожие, но конфликтующие фрагменты.
  7. Оцените стабильность. Повторите каждый ключевой запрос несколько раз и сравните выводы, набор источников и расходы.
  8. Определите порог запуска. Заранее установите допустимую цену задачи, максимальную задержку и минимальную долю ответов, прошедших экспертную проверку.

Главный критерий — не то, насколько убедительно выглядит единичный ответ, а насколько часто модель выдаёт проверяемый результат в пределах вашего бюджета и SLA.

FAQ

Является ли Grok 4.20 Multi Agent Beta 0309 reasoning-моделью?

В паспорте COMRAD404 reasoning отмечен как «нет». В API присутствует параметр reasoning.effort, но официальная документация объясняет, что у multi-agent варианта он переключает конфигурацию между 4 и 16 агентами, а не подтверждает отдельный режим глубины рассуждения.

Что означает LMArena rating 1470,5?

Это статистический рейтинг по слепым попарным сравнениям ответов. Он не означает 1470,5 балла из фиксированного максимума и не показывает процент правильных ответов.

Можно ли считать модель сильной в программировании?

Данных недостаточно. Coding равен 50,0, но отдельные LMArena Code rating и code rank в срезе отсутствуют. Нужен тест на репозиториях, языках и типах ошибок вашей команды.

Сколько стоит один запрос?

Цена зависит от числа токенов, количества агентов, применённых инструментов, режима и действующего тарифа API. В паспорте базовая ставка составляет $1,25 за миллион входных и $2,50 за миллион выходных токенов, но субагенты также создают оплачиваемый расход.

Действительно ли модель принимает миллион токенов?

Такой размер контекста указан в паспорте и официальной документации. Но способность принять объём не гарантирует безошибочного извлечения каждого факта, поэтому длинный контекст необходимо тестировать отдельно.

Можно ли использовать модель в production?

Точная версия в редакционном паспорте имеет статус preview, поэтому её не следует автоматически считать production-ready. Для внедрения нужны пилот, мониторинг качества и затрат, обработка отказов и план замены версии.

Открыты ли веса модели?

Нет. По паспорту это проприетарная модель с закрытыми весами. Доступ через API не делает её открытым программным обеспечением.

Источники

Срез данных: 31 августа 2026 года. Все значения рейтинга приведены исключительно по переданному паспорту COMRAD404. Официальные страницы могут обновляться после даты среза.