
В середине февраля 2025 года компания xAI Илона Маска представила Grok 3 — новое поколение своей языковой модели. Презентация прошла в прямом эфире, и уже через несколько дней вокруг модели развернулась активная дискуссия. Одни называют её прорывом, другие указывают на нестыковки в тестах и неясность с открытым исходным кодом. Собрали основные факты и точки зрения.
Что такое Grok 3 и чем он отличается от предшественников
Grok 3 — это флагманская модель xAI, пришедшая на смену Grok 2, которая вышла летом 2024 года. Согласно заявлениям компании, новая версия обучалась на значительно большем объёме данных и использует улучшенную архитектуру. Основные нововведения:
- Увеличенный контекст — до 1 миллиона токенов, что позволяет обрабатывать очень длинные документы или кодовые базы.
- Мультимодальность — модель может анализировать изображения и отвечать на вопросы по ним.
- Режим DeepSearch — агентный функционал для многошагового поиска и синтеза информации из нескольких источников.
- Два дополнительных режима: Think (с цепочкой рассуждений) и Big Brain (для сложных задач с повышенным потреблением ресурсов).
xAI также анонсировала подписку SuperGrok за 30 долларов в месяц, которая даёт доступ к расширенным возможностям модели и более высоким лимитам запросов.
Тесты и бенчмарки: что показывает Grok 3
На презентации xAI привела результаты тестов, согласно которым Grok 3 превосходит GPT-4o, Claude 3.5 Sonnet и Gemini 2 Pro по ряду бенчмарков, включая AIME (математика), GPQA (научные вопросы) и HumanEval (программирование). В частности, на AIME 2025 модель показала результат 52,2%, тогда как GPT-4o — 39,4%, а Gemini 2 Pro — 28,4%.
Однако результаты были встречены с осторожностью. Независимый исследовательский проект Artificial Analysis провёл собственное тестирование и обнаружил, что качество ответов Grok 3 сильно варьируется в зависимости от нагрузки. В часы пик модель может переключаться на облегчённую версию (Grok 3 mini), что снижает точность. Кроме того, в лидерборде LMSYS Chatbot Arena Grok 3 пока не появился — это площадка, где модели оцениваются пользователями вслепую, и её часто считают более объективным показателем.
| Бенчмарк | Grok 3 (заявлено) | GPT-4o | Claude 3.5 Sonnet | Gemini 2 Pro |
|---|---|---|---|---|
| AIME 2025 (математика) | 52,2% | 39,4% | 32,0% | 28,4% |
| GPQA Diamond (наука) | 79,0% | 76,1% | 71,0% | 74,2% |
| HumanEval (код) | 92,0% | 90,2% | 88,4% | 87,1% |
Важно отметить: данные по конкурентам взяты из открытых источников и могут отличаться в зависимости от версии модели и условий тестирования. xAI не публиковала полную методологию своих замеров.
Споры вокруг прозрачности и open-source
Основная линия критики в адрес xAI связана с тем, что компания не раскрывает детали обучения и не публикует веса модели. Илон Маск ранее критиковал OpenAI и Google за закрытость, а xAI позиционировала себя как более открытый проект. Однако Grok 3 распространяется по проприетарной лицензии, и доступ к API ограничен.
В сообществе разработчиков это вызвало разочарование. Например, на Reddit в ветке r/LocalLLaMA пользователи отмечают, что без публикации весов невозможно проверить заявленные результаты или дообучить модель под свои задачи. Некоторые сравнивают ситуацию с релизом GPT-4, когда OpenAI также не раскрыла архитектуру.
С другой стороны, xAI продолжает развивать открытую модель Grok 1, вышедшую в 2023 году, и не исключено, что облегчённая версия Grok 3 может быть опубликована позже. Пока официальных заявлений на этот счёт нет.
Реакция рынка и доступность
Grok 3 доступен подписчикам X Premium+ (ранее Twitter Blue) и через отдельную подписку SuperGrok. Веб-интерфейс и мобильное приложение уже работают, но пользователи сообщают о перебоях и долгом времени ответа в пиковые часы. В App Store приложение xAI стабильно входит в топ-5 в категории «Производительность», что говорит о высоком спросе.
Аналитики отмечают, что выход Grok 3 усиливает конкуренцию в сегменте мультимодальных моделей. При этом xAI пока заметно уступает OpenAI и Google по объёму вычислительных ресурсов и числу пользователей. Инвестиции компании в суперкомпьютер Colossus в Мемфисе, по разным оценкам, составляют несколько миллиардов долларов, но для удержания позиций потребуются дальнейшие вливания.
Что стоит проверить самостоятельно
Тем, кто хочет составить собственное мнение о Grok 3, стоит учесть несколько моментов. Во-первых, заявленные результаты бенчмарков — это не всегда то же самое, что реальная полезность в повседневных задачах. Во-вторых, модель активно дорабатывается, и её поведение может меняться от недели к неделе. В-третьих, для объективного сравнения стоит дождаться появления Grok 3 в независимых рейтингах вроде Chatbot Arena.
На данный момент Grok 3 — это интересный, но не до конца прозрачный продукт. Решение о его использовании стоит принимать, исходя из конкретных задач и готовности мириться с возможными ограничениями по скорости и доступности.
