Запись архива

Grok 3: что известно о новой модели xAI и почему она вызвала споры

Модель Grok 3 от xAI Илона Маска уже доступна части пользователей. Разбираемся, что известно о новой версии, какие тесты она проходит и почему вокруг неё возникло столько дискуссий.

Редакционная обложка COMRAD404: Grok 3: что известно о новой модели xAI и почему она вызвала споры
Редакционная обложка COMRAD404: Grok 3: что известно о новой модели xAI и почему она вызвала споры
Редакционная тематическая обложка COMRAD404

В середине февраля 2025 года компания xAI Илона Маска представила Grok 3 — новое поколение своей языковой модели. Презентация прошла в прямом эфире, и уже через несколько дней вокруг модели развернулась активная дискуссия. Одни называют её прорывом, другие указывают на нестыковки в тестах и неясность с открытым исходным кодом. Собрали основные факты и точки зрения.

Что такое Grok 3 и чем он отличается от предшественников

Grok 3 — это флагманская модель xAI, пришедшая на смену Grok 2, которая вышла летом 2024 года. Согласно заявлениям компании, новая версия обучалась на значительно большем объёме данных и использует улучшенную архитектуру. Основные нововведения:

  • Увеличенный контекст — до 1 миллиона токенов, что позволяет обрабатывать очень длинные документы или кодовые базы.
  • Мультимодальность — модель может анализировать изображения и отвечать на вопросы по ним.
  • Режим DeepSearch — агентный функционал для многошагового поиска и синтеза информации из нескольких источников.
  • Два дополнительных режима: Think (с цепочкой рассуждений) и Big Brain (для сложных задач с повышенным потреблением ресурсов).

xAI также анонсировала подписку SuperGrok за 30 долларов в месяц, которая даёт доступ к расширенным возможностям модели и более высоким лимитам запросов.

Тесты и бенчмарки: что показывает Grok 3

На презентации xAI привела результаты тестов, согласно которым Grok 3 превосходит GPT-4o, Claude 3.5 Sonnet и Gemini 2 Pro по ряду бенчмарков, включая AIME (математика), GPQA (научные вопросы) и HumanEval (программирование). В частности, на AIME 2025 модель показала результат 52,2%, тогда как GPT-4o — 39,4%, а Gemini 2 Pro — 28,4%.

Однако результаты были встречены с осторожностью. Независимый исследовательский проект Artificial Analysis провёл собственное тестирование и обнаружил, что качество ответов Grok 3 сильно варьируется в зависимости от нагрузки. В часы пик модель может переключаться на облегчённую версию (Grok 3 mini), что снижает точность. Кроме того, в лидерборде LMSYS Chatbot Arena Grok 3 пока не появился — это площадка, где модели оцениваются пользователями вслепую, и её часто считают более объективным показателем.

Бенчмарк Grok 3 (заявлено) GPT-4o Claude 3.5 Sonnet Gemini 2 Pro
AIME 2025 (математика) 52,2% 39,4% 32,0% 28,4%
GPQA Diamond (наука) 79,0% 76,1% 71,0% 74,2%
HumanEval (код) 92,0% 90,2% 88,4% 87,1%

Важно отметить: данные по конкурентам взяты из открытых источников и могут отличаться в зависимости от версии модели и условий тестирования. xAI не публиковала полную методологию своих замеров.

Споры вокруг прозрачности и open-source

Основная линия критики в адрес xAI связана с тем, что компания не раскрывает детали обучения и не публикует веса модели. Илон Маск ранее критиковал OpenAI и Google за закрытость, а xAI позиционировала себя как более открытый проект. Однако Grok 3 распространяется по проприетарной лицензии, и доступ к API ограничен.

В сообществе разработчиков это вызвало разочарование. Например, на Reddit в ветке r/LocalLLaMA пользователи отмечают, что без публикации весов невозможно проверить заявленные результаты или дообучить модель под свои задачи. Некоторые сравнивают ситуацию с релизом GPT-4, когда OpenAI также не раскрыла архитектуру.

С другой стороны, xAI продолжает развивать открытую модель Grok 1, вышедшую в 2023 году, и не исключено, что облегчённая версия Grok 3 может быть опубликована позже. Пока официальных заявлений на этот счёт нет.

Реакция рынка и доступность

Grok 3 доступен подписчикам X Premium+ (ранее Twitter Blue) и через отдельную подписку SuperGrok. Веб-интерфейс и мобильное приложение уже работают, но пользователи сообщают о перебоях и долгом времени ответа в пиковые часы. В App Store приложение xAI стабильно входит в топ-5 в категории «Производительность», что говорит о высоком спросе.

Аналитики отмечают, что выход Grok 3 усиливает конкуренцию в сегменте мультимодальных моделей. При этом xAI пока заметно уступает OpenAI и Google по объёму вычислительных ресурсов и числу пользователей. Инвестиции компании в суперкомпьютер Colossus в Мемфисе, по разным оценкам, составляют несколько миллиардов долларов, но для удержания позиций потребуются дальнейшие вливания.

Что стоит проверить самостоятельно

Тем, кто хочет составить собственное мнение о Grok 3, стоит учесть несколько моментов. Во-первых, заявленные результаты бенчмарков — это не всегда то же самое, что реальная полезность в повседневных задачах. Во-вторых, модель активно дорабатывается, и её поведение может меняться от недели к неделе. В-третьих, для объективного сравнения стоит дождаться появления Grok 3 в независимых рейтингах вроде Chatbot Arena.

На данный момент Grok 3 — это интересный, но не до конца прозрачный продукт. Решение о его использовании стоит принимать, исходя из конкретных задач и готовности мириться с возможными ограничениями по скорости и доступности.