Запись архива

Grok 4 0709: обзор модели, оценки и ограничения

Grok 4 0709 выделяется высокой оценкой пользовательских предпочтений, но занимает 98-е место из-за неполного покрытия независимыми метриками. К августу 2026 года исходный API-вариант уже снят и перенаправляется на другую модель.

Профиль модели Grok 4 0709 с COMRAD Score 60,7, рейтингом LMArena и отметкой о снятии API-версии

Grok 4 0709 не стоит выбирать для новой интеграции как самостоятельную модель: к дате среза, 31 августа 2026 года, этот API-идентификатор уже снят с обслуживания, а запросы к нему перенаправляются на Grok 4.3. Его профиль в рейтинге полезен прежде всего как историческая точка сравнения и как предупреждение для команд, которые продолжают использовать старый slug.

При COMRAD Score 60,7 модель занимает 98-е место. Результат поддерживает высокий суббалл человеческих предпочтений — 82,2, однако независимых данных о совокупном интеллекте, программировании и скорости в паспорте недостаточно. Поэтому уверенность редакционной оценки обозначена как ограниченная.

Коротко

  • Главная сильная сторона: высокий суббалл human preference — 82,2 из 100, опирающийся на заметный массив слепых пользовательских сравнений.
  • Главная проблема: точная версия grok-4-0709 больше не обслуживается как отдельная модель.
  • COMRAD Score: 60,7 из 100 — это нормализованная редакционная оценка, а не процент качества.
  • Место: 98-е в выпуске рейтинга 2026 H2.
  • LMArena: рейтинг текста 1410,9, 133-е место и 39 297 голосов в зафиксированном срезе.
  • Контекст: 256 000 токенов по паспорту.
  • Цена в срезе: $1,25 за миллион входных и $2,50 за миллион выходных токенов. Она зависит от провайдера и маршрутизации API.
  • Нет данных: Artificial Analysis Intelligence Index, скорость генерации, время до первого токена и отдельный LMArena Code rating отсутствуют.

Паспорт модели

Параметр Значение
Модель Grok 4 0709
Организация SpaceXAI
API-идентификатор grok-4-0709
Лицензия Проприетарная
Открытые веса Нет
Reasoning-флаг в паспорте Нет
Preview-флаг Нет
Контекст 256 000 токенов
COMRAD Score 60,7 из 100
Место 98
Уверенность оценки Ограниченная
Статус API на дату среза Исходная модель снята; slug перенаправляется на Grok 4.3

Паспорт фиксирует именно рейтинговый срез, а не обещает постоянство характеристик API. После изменения маршрутизации одинаковая строка grok-4-0709 уже не гарантирует выполнение запроса исходной моделью, с которой были связаны исторические оценки.

Место в рейтинге

Grok 4 0709 находится на 98-й позиции в выпуске рейтинга моделей ИИ COMRAD404 2026 H2. Итог рассчитан по методологии версии 1.0 из пяти нормализованных суббаллов с разными весами: качество — 40%, человеческие предпочтения — 30%, программирование — 15%, эффективность — 10%, доступность — 5%.

Вклад суббаллов составляет 20,0 балла за quality, 24,66 за human preference, 7,5 за coding, 6,37 за efficiency и 2,135 за access. Сумма 60,665 округляется до COMRAD Score 60,7. Таким образом, пользовательское предпочтение дает модели больше баллов, чем качество, хотя вес quality выше. Это происходит из-за заметной разницы между самими оценками: 82,2 против 50,0.

Невысокое место объясняется не одним явным провалом, а сочетанием трех факторов: нейтрального профиля quality и coding, ограниченной доступности и недостатка сырых независимых измерений. Сравнивать позицию только по LMArena неправильно: COMRAD Score объединяет несколько разных характеристик, тогда как Arena отражает результаты слепых парных выборов пользователей.

Разбор пяти суббаллов

Суббалл Оценка Вес Практическое чтение
Quality 50,0 40% Средний редакционный уровень; подтверждающего Intelligence Index в срезе нет
Human preference 82,2 30% Наиболее сильная часть профиля, подкрепленная текстовой LMArena
Coding 50,0 15% Отдельного LMArena Code rating нет, поэтому делать вывод о лидерстве в коде нельзя
Efficiency 63,7 10% Умеренно положительная оценка, но без опубликованных в паспорте замеров скорости
Access 42,7 5% Проприетарные веса и снятие исходного API-варианта ограничивают воспроизводимость

Эти числа являются редакционными нормализованными оценками от 0 до 100. Они не означают, что модель выполняет 82,2% пользовательских задач или правильно пишет 50% программ. Суббаллы нужны для сопоставления разных аспектов модели внутри методологии рейтинга.

Что показывает LMArena

В текстовой категории LMArena паспорт фиксирует рейтинг 1410,9, 133-е место и 39 297 голосов. LMArena rating — статистическая величина, полученная из слепых попарных сравнений ответов. Это не процент правильных решений и не результат экзамена с эталонными ответами.

Большое число голосов делает сигнал пользовательского предпочтения содержательным: оценка не основана на нескольких демонстрациях разработчика. При этом Arena лучше отражает воспринимаемую полезность ответа — стиль, ясность, следование инструкции и общее впечатление — чем строго проверяемую фактическую точность.

Рейтинг также зависит от набора запросов, состава конкурирующих моделей, периода сбора и статистической методики площадки. Поэтому 1410,9 следует читать вместе с местом и числом голосов, не превращая его в универсальную меру интеллекта.

Качество и неопределенность измерений

Artificial Analysis Intelligence Index для Grok 4 0709 в переданном срезе отсутствует. Значение не отмечено как оценочное, поэтому восстанавливать его по результатам семейства Grok 4 или по более новым версиям нельзя. По той же причине официальный набор графиков из анонса Grok 4 не подменяет отсутствующую независимую метрику точной версии.

Для программирования нет LMArena Code rating и места в кодовом рейтинге. Суббалл coding 50,0 остается частью редакционного расчета, но паспорт не дает сырого специализированного показателя, который позволил бы уверенно рекомендовать модель для разработки программного обеспечения.

Ограниченная уверенность означает, что итоговый балл пригоден для предварительной навигации, но не должен быть единственным основанием для закупки или миграции. Профиль human preference здесь существенно лучше документирован, чем качество, кодинг и производительность.

Возможности и сценарии

Официальный анонс семейства Grok 4 описывал работу с текстом и изображениями, контекст 256 000 токенов, вызов инструментов, выполнение кода и поиск по вебу и X. Карточка модели также характеризовала Grok 4 как систему с рассуждением и инструментальными возможностями. Эти заявления относятся к семейству и развертываниям Grok 4; их нельзя автоматически переносить на любую нынешнюю обработку запросов по старому slug.

По сочетанию LMArena и контекста историческая версия представляла интерес для следующих задач:

  • подготовки и редактирования текстов, где важны естественность и субъективное качество ответа;
  • анализа длинных документов с обязательной внешней проверкой выводов;
  • диалоговых ассистентов и прототипов, оцениваемых живыми пользователями;
  • исследовательских сценариев с поиском и инструментами, если конкретная API-конфигурация действительно предоставляла эти функции;
  • сопоставления поведения старой интеграции с моделью, на которую провайдер перенаправил запросы.

Для нового продукта практическая ценность профиля иная: он помогает распознать технический долг. Если в конфигурации остался grok-4-0709, команда должна считать его устаревшим алиасом, выяснить фактический backend и явно выбрать поддерживаемую модель.

Reasoning: расхождение паспорта и документации

В переданном паспорте флаг reasoning установлен в значение false. Одновременно официальный анонс называл Grok 4 reasoning-моделью, а руководство по снятию моделей относит grok-4-0709 к reasoning-нагрузкам и перенаправляет его на Grok 4.3 с уровнем reasoning effort low.

Это расхождение нельзя устранять догадкой. В рейтинговом профиле сохраняется значение паспорта, поскольку оно является входным фактом среза. Для практической интеграции следует ориентироваться на текущую документацию API и проверять фактические поля ответа, доступные параметры и расход токенов. Наличие рассуждения в маркетинговом или семейном описании не гарантирует отдельный управляемый режим у конкретного исторического endpoint.

Цена и скорость

Паспорт указывает $1,25 за миллион входных токенов и $2,50 за миллион выходных. Например, запрос с 100 000 входных и 10 000 выходных токенов стоил бы около $0,15 без учета кэширования, инструментов, поиска, дополнительных запросов и наценки посредника: $0,125 за ввод плюс $0,025 за вывод.

Однако после 15 мая 2026 года обращения к grok-4-0709 автоматически обслуживаются Grok 4.3, а официальный документ предупреждает о применении цены модели-замены. Следовательно, указанную стоимость нельзя трактовать как неизменный тариф исходной Grok 4 0709. Перед расчетом бюджета нужно запросить актуальную карточку модели у используемого API-провайдера и проверить счет на тестовой нагрузке.

Данных о скорости вывода в токенах в секунду и времени до первого токена в паспорте нет. Суббалл efficiency 63,7 не позволяет восстановить эти величины. Нельзя обещать ни быстрый первый ответ, ни определенную пропускную способность: они зависят от маршрута API, режима рассуждения, длины контекста, нагрузки и провайдера.

Контекст 256 000 токенов — отдельная техническая характеристика, а не показатель скорости или качества. Большое окно не означает, что модель одинаково надежно использует информацию в любой его части. Для длинных документов нужны тесты на поиск деталей, связывание удаленных фрагментов и устойчивость к противоречиям.

Доступность, лицензия и воспроизводимость

Модель проприетарная, ее веса не опубликованы. Развернуть Grok 4 0709 на собственной инфраструктуре, зафиксировать веса или независимо исследовать внутреннюю архитектуру по открытому репозиторию нельзя. Данных о размере, числе параметров и точной архитектуре в использованных первичных материалах для этой версии нет.

Репозиторий xai-org/grok-prompts содержит файл защитного системного префикса, связанный с grok-4-0709. Это подтверждает существование точного API-идентификатора и дает ограниченную прозрачность на уровне инструкций. Лицензия репозитория распространяется на опубликованные файлы, но не превращает саму модель в открытое программное обеспечение и не открывает ее веса.

Официальная страница, ранее соответствовавшая точной версии, теперь перенаправляет на общий каталог моделей. Отдельная актуальная карточка именно для grok-4-0709 на дату исследования не обнаружена. Доступна карточка семейства Grok 4, но она не раскрывает архитектуру или параметры точного снапшота 0709.

Ограничения

  • Снятие модели. С 15 мая 2026 года API-slug перенаправляется на Grok 4.3, поэтому повторный тест уже не обязательно воспроизводит историческое поведение.
  • Неполные независимые данные. Нет Artificial Analysis Intelligence Index, замеров скорости, TTFT и LMArena Code rating.
  • Неясность reasoning-метаданных. Паспорт и официальное описание используют разные классификации.
  • Закрытые веса. Нельзя развернуть исходную модель локально или зафиксировать ее бинарный артефакт.
  • Цена неотделима от маршрутизации. Старый slug может тарифицироваться как модель-замена.
  • Контекст не равен надежности. 256 000 токенов требуют проверки на реальных длинных материалах.
  • Arena не измеряет истинность напрямую. Высокое человеческое предпочтение не исключает фактических ошибок и убедительных галлюцинаций.

Кому модель подходит

Профиль подходит исследователям, аудиторам и владельцам унаследованных систем, которым нужно понять, что представлял собой grok-4-0709 в рейтинговом срезе. Он также полезен при расследовании изменения качества после автоматического перенаправления старого endpoint.

Для новой production-интеграции выбирать этот идентификатор не следует: он больше не закрепляет исходную модель. Это не означает, что ответ по старому slug обязательно будет плохим; проблема в отсутствии контроля над идентичностью backend. Явный выбор поддерживаемой модели облегчает тестирование, бюджетирование, управление reasoning effort и разбор инцидентов.

Как проверить на своей задаче

  1. Зафиксируйте фактическую модель. Запишите отправленный slug, ответ API, дату, провайдера, регион и режим. Проверьте, сообщает ли сервис о перенаправлении.
  2. Соберите 50–200 реальных примеров. Включите типичные запросы, редкие случаи, конфликтующие инструкции и материалы максимальной рабочей длины.
  3. Отделите качество от предпочтения. Для задач с эталоном измеряйте точность, полноту и число ошибок. Для текстов проводите слепое попарное сравнение экспертами.
  4. Проверьте длинный контекст. Разместите важные факты в начале, середине и конце документа; добавьте похожие отвлекающие фрагменты.
  5. Измерьте код отдельно. Запускайте тесты, линтер и статический анализ. Не оценивайте код только по убедительности объяснения.
  6. Снимите latency. Для каждого запроса сохраняйте время до первого токена, полное время, число входных и выходных токенов и долю ошибок API.
  7. Рассчитайте стоимость. Используйте фактический счет провайдера, включая инструменты, повторные запросы, кэширование и reasoning-токены, если они выделяются.
  8. Повторите тест с явной моделью-заменой. Сравните старый slug и прямо указанный актуальный endpoint. Если результаты совпадают, это подтвердит маршрутизацию на практике, но не восстановит поведение оригинала.

Минимальный критерий принятия решения — не средняя оценка, а порог по критическим ошибкам. Для юридических, медицинских, финансовых и других чувствительных задач отдельно считайте неподтвержденные факты, пропущенные оговорки и ложные ссылки.

FAQ

Стоит ли подключать Grok 4 0709 в новый продукт?

Нет, не как самостоятельную фиксированную модель. Исходный вариант снят, а старый slug перенаправляется на Grok 4.3. Для новой системы лучше явно выбрать поддерживаемый endpoint и протестировать его.

Является ли Grok 4 0709 reasoning-моделью?

В паспорте reasoning-флаг равен false, но официальные материалы семейства и руководство по миграции относят версию к reasoning-нагрузкам. Это расхождение следует учитывать и проверять фактическое API-поведение.

Что означает LMArena rating 1410,9?

Это статистический рейтинг по слепым попарным сравнениям ответов. Он не означает 1410,9 балла качества из фиксированного максимума и не является процентом правильных ответов.

Сколько стоит использование модели?

В паспорте указаны $1,25 за миллион входных и $2,50 за миллион выходных токенов. После снятия endpoint стоимость определяется моделью, на которую направляется запрос, а также условиями конкретного провайдера.

Можно ли запустить Grok 4 0709 локально?

Нет. Веса не открыты, лицензия модели проприетарная. Публичный репозиторий системных промптов не содержит весов и не делает модель открытым ПО.

Почему уверенность оценки ограниченная?

В срезе отсутствуют Intelligence Index, специализированный кодовый рейтинг и показатели скорости. Кроме того, историческую модель уже нельзя надежно вызвать по ее прежнему slug без автоматической подмены.

Источники

  • Официальный анонс Grok 4 — описание семейства, даты представления, контекста, инструментов и заявленных возможностей API.
  • Grok 4 Model Card — официальная карточка семейства, сведения о развертывании, оценках безопасности и ограничениях.
  • Grok Model Retirement on May 15, 2026 — снятие grok-4-0709, перенаправление на Grok 4.3 и изменение тарификации.
  • Страница модели Grok 4 0709 — прежний официальный адрес точной версии, который на дату исследования перенаправляет в общий каталог моделей.
  • Репозиторий Grok Prompts — связь опубликованного защитного системного префикса с API-моделью grok-4-0709.
  • LMArena Text Leaderboard — источник текстового Arena rating, места и числа голосов в зафиксированном срезе.
  • Artificial Analysis LLM Leaderboard — проверяемый источник Intelligence Index, цен и производительности; для точной версии данных в паспорте нет.