Запись архива

Gemini 3 Pro: обзор модели Google по рейтингу COMRAD404

Gemini 3 Pro занимает 62-е место в рейтинге COMRAD404: модель особенно сильна в слепых текстовых сравнениях, но теряет баллы за эффективность, доступность измерений и кодовый результат.

Gemini 3 Pro — профиль модели Google с рейтингом COMRAD404 и таблицей метрик

Gemini 3 Pro — модель для задач, где важнее качество диалога, работа с длинным контекстом и мультимодальными материалами, чем минимальная стоимость одного запроса. В срезе COMRAD404 от 31 августа 2026 года она получила 63,2 балла и заняла 62-е место. Это не позиция универсального лидера: профиль модели заметно неоднороден. Текстовый результат в LMArena выглядит сильнее кодового, человеческое предпочтение получило максимальный нормализованный суббалл, а эффективность стала главным ограничителем итоговой оценки.

Паспорт также показывает важную практическую деталь: у Gemini 3 Pro заявлен контекст до 1 048 576 токенов, вход стоит 2 доллара за миллион токенов, выход — 12 долларов за миллион. При этом в зафиксированном срезе нет данных о скорости генерации, времени до первого токена и Artificial Analysis Intelligence Index. Поэтому модель разумно рассматривать не как гарантированно быструю или дешёвую, а как инструмент для содержательных, длинных и визуально насыщенных рабочих процессов.

Коротко

  • Место: 62-е в рейтинге COMRAD404, редакция 2026 H2.
  • COMRAD Score: 63,2 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
  • Сильнейший профильный сигнал: human preference — 100,0 из 100 в редакционной шкале.
  • Независимые рейтинги: LMArena Text — 1485,6 и 14-е место; LMArena Code — 1438,2 и 54-е место.
  • Контекст: 1 048 576 токенов.
  • Цена в паспорте: 2 доллара за миллион входных токенов и 12 долларов за миллион выходных токенов.
  • Статус: в паспорте COMRAD404 модель не отмечена как preview; открытых весов нет, лицензия proprietary.

Итоговый вывод простой: Gemini 3 Pro стоит проверять там, где модель должна удерживать большой объём материала, разбирать документы, изображения или экранные данные и формулировать ответ, который пользователь действительно предпочитает. Для массовых коротких запросов с жёстким бюджетом её профиль менее убедителен, особенно с учётом разницы между ценой входа и выхода.

Паспорт модели

Параметр Значение Как это читать
Модель Gemini 3 Pro Конкретная модель из паспорта COMRAD404
Разработчик Google Коммерческий закрытый продукт
COMRAD Score 63,2/100 Нормализованная редакционная оценка
Место 62 Позиция в редакции 2026 H2
Лицензия Proprietary Не открытое ПО и не набор открытых весов
Open weights Нет Весами нельзя свободно распоряжаться как у open-weight-моделей
Reasoning Нет Поле паспорта не отмечает отдельный reasoning-режим
Preview Нет В срезе модель не классифицирована как preview
Контекст 1 048 576 токенов Единица измерения — токены, а не страницы и не символы

Паспорт описывает модель в редакционном срезе, а не обещает неизменные характеристики на всех площадках. В API-провайдерах могут отличаться лимиты, доступные функции, тарифные условия, очереди и режимы обработки. Поэтому данные таблицы следует использовать для первичного выбора, а не как замену проверке конкретного endpoint.

Место в рейтинге

62-е место при COMRAD Score 63,2 означает, что Gemini 3 Pro находится в рабочей середине расширенного рейтинга, но не получает статуса модели без заметных компромиссов. Итог складывается из пяти нормализованных суббаллов с весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. Такая формула объясняет, почему очень сильный результат в одном типе теста не превращается автоматически в первое место.

Для сравнения редакционной логики полезно разделять два уровня. LMArena показывает положение модели внутри конкретных слепых попарных сравнений. COMRAD404 переводит несколько источников и редакционных критериев в единую шкалу. Рейтинг LMArena Text 1485,6 при 40 674 голосах и 14-м месте — статистический результат пользовательских сравнений, а не доля ответов, признанных правильными. Точно так же LMArena Code 1438,2 и 54-е место не означают, что модель «правильно пишет 54% кода».

Внутри COMRAD404 модель занимает позицию, где качество взаимодействия заметно поддерживает итог, но дорогой выход и отсутствие части эксплуатационных измерений ограничивают оценку. Подробная методика и сам рейтинг доступны на странице рейтинга COMRAD404.

Разбор пяти суббаллов

Суббалл Оценка Вес Редакционная интерпретация
Quality 50,0/100 40% Средняя позиция по сводной шкале качества; главный вес делает этот показатель критичным
Human preference 100,0/100 30% Максимальный нормализованный результат предпочтения пользователей в используемом срезе
Coding 55,9/100 15% Умеренно сильный показатель, но не профильный максимум; согласуется с 54-м местом в Code Arena
Efficiency 23,4/100 10% Главная слабость профиля: стоимость или эксплуатационные параметры заметно ухудшают итог
Access 50,0/100 5% Средняя оценка доступности в редакционной модели, без вывода о доступности для каждого региона

Суббаллы нельзя читать как проценты успешных ответов. Например, human preference 100,0 не означает, что все пользователи выбрали Gemini 3 Pro во всех сравнениях. Это нормализованная оценка COMRAD404. Её смысл — показать относительную силу модели по принятой редакционной шкале.

Что показывают независимые измерения

Наиболее заметный внешний сигнал — разрыв между текстовым и кодовым рейтингами LMArena. В Text Arena Gemini 3 Pro получила 1485,6, 14-е место и 40 674 голоса. В Code Arena — 1438,2 и 54-е место. Разница не доказывает, что модель плохо программирует: эти рейтинги измеряют разные пользовательские предпочтения и задачи. Но для выбора это полезный предупреждающий знак: сильное общее общение не следует автоматически переносить на разработку, отладку и генерацию больших патчей.

В паспорте нет Artificial Analysis Intelligence Index. Это принципиальное ограничение: нельзя подставлять в статью число из другого среза, другой версии или стороннего пересказа. Также отсутствуют значения output tokens per second и time to first token seconds. Поэтому редакция не делает выводов о том, насколько Gemini 3 Pro быстрее или медленнее других моделей.

У LMArena есть статистическая погрешность, зависимость от состава запросов и изменение рейтинга со временем. Числа из паспорта относятся к зафиксированному срезу, а не к вечному свойству модели. Если провайдер обновит endpoint или изменит маршрутизацию, практический результат может отличаться.

Возможности и сценарии

Официальные материалы Google описывают Gemini 3 Pro как мультимодальную модель с акцентом на понимание документов, пространственных отношений, экранов и видео. Это не независимое подтверждение всех маркетинговых формулировок, а заявление разработчика; в редакционной статье оно используется для описания заявленного профиля, а не как замена измерениям COMRAD404. ([blog.google](https://blog.google/innovation-and-ai/technology/developers-tools/gemini-3-pro-vision/?utm_source=openai))

Документы и большие корпуса

Контекст в 1 048 576 токенов делает модель кандидатом для анализа крупных наборов материалов: договоров, технических спецификаций, исследовательских архивов, журналов инцидентов и нескольких связанных файлов. Практическая ценность зависит не только от лимита. Нужно проверить, на какой глубине модель находит нужный фрагмент, как ведёт себя при противоречиях и не начинает ли уверенно смешивать сведения из разных частей корпуса.

Визуальный анализ

Сценарии для скриншотов, схем, таблиц, интерфейсов и PDF выглядят естественным направлением проверки. Модель можно тестировать на извлечении данных из сложной страницы, сопоставлении элементов диаграммы и объяснении ошибок в интерфейсе. Для критичных документов обязательна ручная сверка: официальная страница Google прямо указывает на сложные задачи визуального и пространственного понимания, но не превращает результат в безошибочную систему распознавания.

Инструменты и агентные процессы

Документация Google описывает function calling, включая передачу мультимодальных ответов функций для Gemini 3 Pro и потоковую передачу аргументов вызова. Для многошаговых процессов важны thought signatures: при использовании функций их нужно корректно возвращать в следующем запросе, иначе документация предупреждает о возможной ошибке 400. ([docs.cloud.google.com](https://docs.cloud.google.com/vertex-ai/generative-ai/docs/multimodal/function-calling?utm_source=openai))

Отсюда вытекает практический сценарий: модель может быть полезна как координатор поиска данных, анализа вложений и последовательных действий, но интеграцию нельзя строить только на красивом демо. Необходимо проверить восстановление состояния после вызова инструмента, обработку повторов, тайм-ауты и отказ модели от небезопасных или неподтверждённых действий.

Код и техническая работа

Средний coding-суббалл 55,9 и 54-е место в Code Arena позволяют рассматривать Gemini 3 Pro как инструмент для генерации, объяснения и ревью кода, но не как безусловный выбор для автономного внесения изменений. Её разумнее подключать к задачам с тестами, статическим анализом и обязательным просмотром diff: модель должна предлагать изменения, а не получать право без проверки менять production-код.

Цена и скорость

В зафиксированном паспорте указаны 2 доллара за миллион входных токенов и 12 долларов за миллион выходных токенов. Это разные единицы тарификации: вход оплачивается отдельно от выхода, а миллион токенов не равен миллиону слов. При длинном контексте стоимость может быстро расти из-за повторной передачи истории, документов и результатов инструментов.

Для иллюстрации: запрос с 100 000 входных и 10 000 выходных токенов по этим ставкам стоил бы около 0,32 доллара до учёта возможных особенностей провайдера и режима. Расчёт показывает структуру цены, но не является гарантированным счётом: тарифы, скидки, пакетные режимы, лимиты и правила округления могут различаться.

Скорость в срезе не измерена: значения output tokens per second и time to first token seconds отсутствуют. Поэтому нельзя честно обещать пользователю конкретную задержку, пропускную способность или пригодность для интерактивного интерфейса. Перед запуском нужно измерить p50 и p95 времени до первого токена и полной генерации на собственном регионе, провайдере, размере контекста и лимитах.

Официальный материал Google о запуске указывал цену 2 и 12 долларов для API на старте и описывал доступ через Google AI Studio и Vertex AI; это подтверждает наличие соответствующего сценария доступа, но не отменяет оговорку о зависимости цены и режима от конкретного API-провайдера. ([blog.google](https://blog.google/innovation-and-ai/technology/developers-tools/gemini-3-developers/?utm_source=openai))

Ограничения

  • Закрытая модель. Open weights отсутствуют, лицензия proprietary. Нельзя планировать локальный запуск, аудит весов или свободное изменение модели как для открытого ПО.
  • Нет полного набора эксплуатационных данных. В срезе отсутствуют Intelligence Index, скорость вывода и время до первого токена. Это уменьшает точность сравнения для realtime-продуктов.
  • Неоднородный кодовый профиль. Текстовый рейтинг значительно выше кодового места. Для программирования нужны собственные тесты на репозитории, а не перенос ожиданий из общего диалога.
  • Стоимость выхода. 12 долларов за миллион выходных токенов — отдельная статья расходов. Длинные ответы, цепочки инструментов и повторная генерация могут быть дороже, чем кажется по цене входа.
  • Риск ошибок в документах и изображениях. Даже сильное мультимодальное понимание не гарантирует точного чтения мелкого текста, рукописных фрагментов, таблиц и неоднозначных схем.
  • Интеграционная сложность. Function calling и thought signatures требуют аккуратной реализации истории сообщений и обработки ошибок. Это особенно важно в многошаговых агентных сценариях.
  • Изменяемость API. Тарифы, лимиты, названия endpoint, доступные функции и задержки зависят от поставщика и режима. Паспорт отражает только дату 31 августа 2026 года.

Есть и методологическое ограничение рейтинга. COMRAD Score объединяет несколько нормализованных оценок, а LMArena отражает выбор участников слепых сравнений. Эти показатели полезны вместе, но не отвечают на вопрос о точности именно вашего процесса: юридической экспертизы, поддержки клиентов, SQL-генерации или анализа медицинских документов.

Кому модель подойдёт

Gemini 3 Pro имеет смысл рассматривать командам, которым нужны длинные контексты, работа с визуальными материалами и сильное пользовательское восприятие ответа. Это могут быть аналитические ассистенты, инструменты разбора документации, прототипы интерфейсов по скриншотам, внутренние базы знаний и агентные процессы с внешними функциями.

Модель менее очевидна для задач, где главный критерий — минимальная цена, предсказуемая задержка или локальное развёртывание. В таких случаях паспорт не даёт достаточных оснований обещать нужный результат: скорость не измерена, доступность оценивается лишь на 50,0 из 100, а веса закрыты.

Как проверить на своей задаче

  1. Соберите реальный набор. Возьмите 30–100 запросов из рабочего процесса, включая обычные, пограничные и заведомо сложные случаи. Не используйте только демонстрационные примеры.
  2. Разделите входы по типу. Отдельно оцените короткий текст, длинный документ, PDF с таблицами, изображения, скриншоты, код и задачи с инструментами.
  3. Зафиксируйте критерии. Для текста измеряйте точность и полноту, для кода — прохождение тестов и размер лишних изменений, для документов — правильность ссылок на исходные фрагменты.
  4. Проверьте длинный контекст. Разложите ключевые факты в начале, середине и конце материала. Добавьте похожие, но ложные сведения и проверьте, отличает ли их модель.
  5. Посчитайте экономику. Запишите входные и выходные токены, число повторов, вызовы инструментов и стоимость неудачных попыток. Отдельно измерьте короткий и длинный режимы.
  6. Измерьте задержку. Соберите минимум p50 и p95 для времени до первого токена и полной генерации на том же провайдере, который будет использоваться в продукте.
  7. Проверьте отказоустойчивость. Имитируйте тайм-аут инструмента, пустой ответ, неверный JSON, повторный вызов и потерю части истории. Для Gemini 3 Pro отдельно проверьте корректную передачу thought signatures.
  8. Сравните с базовой линией. Используйте текущую модель вашей системы и одинаковые промпты, лимиты, контекст и критерии. Не переносите числа LMArena на собственный датасет.
  9. Запустите ограниченный пилот. Сначала включите логирование, ручную модерацию и потолок расходов. Только после этого оценивайте переход к автоматическим действиям.

Минимальный тестовый отчёт должен содержать не только среднюю оценку, но и список провалов: галлюцинации, неверное извлечение чисел, пропущенные ограничения, невалидные вызовы функций и стоимость одного успешно завершённого сценария.

FAQ

Какое место занимает Gemini 3 Pro?

В редакции COMRAD404 2026 H2 модель занимает 62-е место и получает COMRAD Score 63,2 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.

Почему у модели высокий human preference?

В паспорте human preference равен 100,0 из 100. Это максимальный нормализованный суббалл COMRAD404, построенный на принятой редакцией шкале. Он не означает, что 100% пользователей выбирают модель в любой задаче.

Хорошо ли Gemini 3 Pro подходит для программирования?

Паспорт даёт coding-суббалл 55,9, а в LMArena Code модель занимает 54-е место с рейтингом 1438,2. Это аргумент в пользу пилота с тестами и ревью, но не основание для полностью автономной разработки.

Сколько стоит Gemini 3 Pro?

В зафиксированном срезе указаны 2 доллара за миллион входных токенов и 12 долларов за миллион выходных токенов. Итоговые расходы зависят от длины контекста, числа повторов, режима и API-провайдера.

Какая скорость генерации у модели?

В паспорте нет данных о output tokens per second и time to first token seconds. Поэтому конкретную скорость нужно измерять самостоятельно на выбранном endpoint и рабочем размере контекста.

Можно ли запустить Gemini 3 Pro локально?

Нет оснований планировать локальный запуск: в паспорте указаны proprietary-лицензия и отсутствие открытых весов. Доступ следует рассматривать через поддерживаемые сервисы Google или совместимые API-площадки.

Подходит ли модель для анализа больших документов?

Контекст 1 048 576 токенов и заявленные Google мультимодальные возможности делают такой сценарий перспективным. Но на собственных документах нужно проверить извлечение фактов, поиск информации в середине контекста, работу с таблицами и устойчивость к противоречиям.

Источники

  • COMRAD404 AI Ranking — место модели, COMRAD Score, суббаллы и зафиксированные сырые метрики.
  • LMArena Text Leaderboard — текстовый рейтинг, место и число пользовательских голосов, использованные в паспорте.
  • LMArena Leaderboard — результаты Code Arena, использованные в кодовом суббалле.
  • Google: Gemini 3 for developers — официальный материал о запуске, API-доступе, заявленных сценариях и стартовой цене.
  • Google: Gemini 3 Pro — the frontier of vision AI — официальное описание заявленных возможностей работы с документами, пространством, экранами и видео.
  • Google Cloud: Function calling — документация по вызову функций и мультимодальным ответам функций.
  • Google Cloud: Thought signatures — документация по сохранению состояния рассуждения в многошаговых вызовах.
  • Google DeepMind: Model cards — официальный каталог карточек моделей; в каталоге присутствует карточка Gemini 3 Pro.

Примечание о срезе: числовые значения рейтинга, цены, контекста и доступных измерений взяты только из переданного паспорта модели. Официальные материалы Google использованы для проверки названия, разработчика, заявленных сценариев и документации; они не заменяют редакционные оценки COMRAD404.