Запись архива

Gemini 3.1 Pro Preview: сильное рассуждение с дорогим ожиданием

Gemini 3.1 Pro Preview выделяется максимальным суббаллом человеческих предпочтений и контекстом на миллион токенов, но теряет позиции из-за задержки первого ответа, цены генерации и неровных результатов в кодовых сравнениях.

Профиль Gemini 3.1 Pro Preview с оценками качества, кода, эффективности, цены и скорости

Gemini 3.1 Pro Preview стоит выбирать для сложного анализа, длинных документов и агентных процессов, где качество итогового рассуждения важнее мгновенного отклика. Профиль модели неоднороден: она получает максимальный нормализованный суббалл человеческих предпочтений, но заметно уступает собственному уровню по эффективности и коду. Поэтому 22-е место в рейтинге COMRAD404 — не признак слабой модели, а результат высокой цены ожидания и менее убедительного баланса характеристик.

Коротко

  • COMRAD Score: 78,4 из 100; это нормализованная редакционная оценка, а не процент правильных ответов.
  • Место: 22-е в выпуске рейтинга 2026 H2 при высокой уверенности редакции в данных.
  • Главная сила: человеческие предпочтения — суббалл 100,0 из 100.
  • Главный компромисс: эффективность — 39,4 из 100 при времени до первого токена 25,69 секунды.
  • Контекст: 1 000 000 токенов по зафиксированному паспорту.
  • Статус: проприетарная reasoning-модель с закрытыми весами, доступная в preview.

Практический вывод: Gemini 3.1 Pro Preview разумно включать в шорт-лист для исследовательских, мультимодальных и многошаговых задач. Для интерактивного интерфейса с жёстким требованием к задержке или для массовой генерации длинных ответов её нужно сначала проверить на стоимости и времени полного цикла.

Паспорт модели

Параметр Значение в срезе
Разработчик Google
Статус Preview
Лицензирование Proprietary
Открытые веса Нет
Режим рассуждения Есть
COMRAD Score 78,4
Artificial Analysis Intelligence Index 47,7
LMArena Text 1486,7; место 13; 101 163 голоса
LMArena Code 1445,7; место 51
Цена API $2 за 1 млн входных и $12 за 1 млн выходных токенов
Скорость вывода 122,1 токена в секунду
Время до первого токена 25,69 секунды
Контекст 1 000 000 токенов

Цены и скорость относятся к зафиксированным условиям измерения. Они зависят от API-провайдера, региона, режима инференса, длины запроса, нагрузки и других параметров. Рассматривать их как постоянный тариф или гарантированную производительность нельзя.

Место в рейтинге

В выпуске рейтинга ИИ-моделей COMRAD404 2026 H2 Gemini 3.1 Pro Preview занимает 22-е место с результатом 78,4. Методология 1.0 сводит пять нормализованных суббаллов в интегральную оценку: качество имеет вес 40%, человеческие предпочтения — 30%, код — 15%, эффективность — 10%, доступность — 5%.

Такое место объясняется контрастом между привлекательностью ответов и эксплуатационными характеристиками. Высокий результат LMArena Text и суббалл предпочтений 100,0 поддерживают итоговую оценку. Одновременно эффективность 39,4 и кодовый суббалл 67,3 ограничивают позицию. Небольшой вес доступности не позволяет полностью компенсировать закрытые веса, preview-статус и зависимость от облачной инфраструктуры Google.

Отдельные места в LMArena не следует напрямую сопоставлять с 22-м местом COMRAD404. Текстовый ранг 13 и кодовый ранг 51 относятся к конкретным аренам и их слепым попарным сравнениям. COMRAD404 применяет собственную нормализацию и объединяет несколько измерений. LMArena rating также не является процентом правильных ответов.

Разбор пяти суббаллов

Суббалл Оценка Вес Редакционная интерпретация
Качество 77,1 40% Сильный общий уровень, но не безусловное преимущество по независимому индексу
Человеческие предпочтения 100,0 30% Ключевая сторона профиля: ответы часто выигрывают слепые сравнения
Код 67,3 15% Модель пригодна для разработки, но Code Arena указывает на необходимость проверки
Эффективность 39,4 10% Слабое место из-за задержки, стоимости и общего профиля производительности
Доступность 69,8 5% Есть несколько облачных каналов, однако веса закрыты, а версия остаётся предварительной

Все пять значений — редакционные оценки по шкале 0–100. Например, 100,0 по человеческим предпочтениям означает максимум после нормализации внутри методологии, а не идеальное качество каждого ответа. Аналогично 77,1 по качеству нельзя читать как 77,1% решённых задач.

Что показывают независимые измерения

Artificial Analysis Intelligence Index равен 47,7. Это самостоятельный составной индекс со своей методикой и шкалой; его нельзя смешивать с COMRAD Score. В паспорте показатель помечен как измеренный, а не оценочный. Он поддерживает вывод о хорошем интеллектуальном уровне модели, но не подтверждает абсолютного лидерства.

В текстовой LMArena модель получила rating 1486,7, 13-е место и 101 163 голоса. Большое число голосов делает сигнал пользовательских предпочтений содержательным в рамках самой арены. При этом слепое попарное голосование измеряет, какой ответ участники предпочли в конкретных парах, а не фактическую точность, безопасность или пригодность для бизнеса.

Кодовый профиль слабее: LMArena Code фиксирует rating 1445,7 и 51-е место. Это не означает, что модель не умеет программировать. Расхождение показывает, что убедительный текстовый ответ и надёжное решение инженерной задачи — разные качества. Код следует оценивать через сборку, тесты, линтер, статический анализ и запуск в изолированной среде.

Возможности и сценарии

Google официально описывает Gemini 3.1 Pro как мультимодальную reasoning-модель для сложных задач и указывает поддержку текстовых, графических, видео-, аудио- и PDF-входов с текстовым выходом. Документация API также перечисляет thinking, function calling, structured outputs, code execution, URL context, кэширование и поисковое заземление. Это заявления разработчика о продуктовых возможностях, а не независимое подтверждение качества каждого инструмента.

Где профиль выглядит уместно

  • Анализ крупных массивов документов. Контекст на миллион токенов позволяет передавать большие подборки договоров, отчётов, спецификаций или материалов исследования. Полезность зависит от способности модели находить нужные фрагменты, поэтому одного формального размера окна недостаточно.
  • Многошаговое исследование. Reasoning и вызов инструментов подходят для процессов, где нужно построить план, получить данные из нескольких систем и оформить проверяемый результат.
  • Разбор репозиториев. Большой контекст удобен для навигации по проекту, поиска связей между модулями, подготовки плана рефакторинга и анализа ошибок.
  • Мультимодальная работа. Модель можно рассматривать для разбора PDF, изображений, аудио и видео вместе с текстовыми инструкциями.
  • Прототипирование интерфейсов и автоматизаций. Она способна генерировать код и использовать инструменты, но результат необходимо проверять исполнением, особенно с учётом 51-го места в Code Arena.
  • Подготовка сложных текстов. Высокий суббалл человеческих предпочтений делает модель интересной для черновиков, объяснений, синтеза аргументов и редакторской переработки.

Контекст и инструменты

Миллион токенов — важная, но не самодостаточная характеристика. Большой запрос повышает стоимость входа, усложняет поиск релевантных свидетельств и может увеличить задержку. Вместо постоянной отправки всего архива стоит сравнить как минимум три схемы: полный контекст, выборку через поиск по документам и иерархическое суммирование.

Для агентного использования важнее не наличие function calling само по себе, а устойчивость цепочки: корректный выбор функции, заполнение аргументов, обработка ошибки и прекращение цикла после достижения цели. Официальная документация упоминает отдельный API-вариант gemini-3.1-pro-preview-customtools, оптимизированный для сочетания пользовательских инструментов и командной оболочки. Google одновременно предупреждает, что на задачах без такой потребности качество этого варианта может колебаться.

Архитектура, число параметров и состав обучающего корпуса для точной preview-версии публично не раскрыты в объёме, достаточном для независимого воспроизведения. Карточка указывает, что Gemini 3.1 Pro основана на Gemini 3 Pro, а за дополнительными сведениями отсылает к карточке предыдущей основы. Домысливать размер модели или устройство сети по этому описанию нельзя.

Цена и скорость

В срезе цена составляет $2 за миллион входных и $12 за миллион выходных токенов. Выход в шесть раз дороже входа, поэтому бюджет сильнее зависит от длины генерации, чем от одинакового объёма переданного текста. Например, агент, многократно переписывающий длинный план, может оказаться существенно дороже компактного классификатора на том же API.

Зафиксированная скорость вывода — 122,1 токена в секунду. После начала генерации это хороший темп для длинного ответа. Однако время до первого токена составляет 25,69 секунды: пользователь может долго не видеть результата. Такой профиль терпим для фоновой обработки отчёта, но неудобен для автодополнения, голосового диалога, чат-поддержки с жёстким SLA и интерфейсов, где ответ ожидается немедленно.

Перед внедрением следует считать не только цену одного успешного запроса, но и стоимость повторов, инструментальных шагов, кэширования, неудачных вызовов и контроля качества. Тарифы и фактическая скорость могут измениться после даты среза или различаться между Gemini API, Vertex AI и режимами обслуживания.

Кому модель подходит

Gemini 3.1 Pro Preview подходит командам, которым нужны длинный контекст, мультимодальный вход и сложные рассуждения в экосистеме Google. Особенно логично тестировать её для асинхронной аналитики, обработки больших документов, прототипов исследовательских агентов и задач, где стиль и полезность ответа оценивает человек.

Она менее очевидна для стартапа с минимальным бюджетом на генерацию, систем реального времени и проектов, которым необходимы локальное развёртывание, контроль весов или стабильный производственный контракт именно на эту версию. Для критичного программного кода модель лучше использовать как помощника под тестовым контуром, а не как источник изменений, автоматически попадающих в production.

Ограничения

  • Preview — не production-ready. Предварительный статус означает возможность изменений поведения, доступности, идентификаторов, лимитов и условий использования.
  • Закрытые веса. Модель нельзя считать открытым ПО или open-weights решением; эксплуатация зависит от сервисов и правил Google.
  • Высокая начальная задержка. 25,69 секунды до первого токена могут стать главным препятствием для интерактивных продуктов.
  • Неровный кодовый профиль. Суббалл 67,3 и 51-е место в Code Arena требуют проверки на собственном языке, стеке и типе задач.
  • Дорогой длинный вывод. Цена $12 за миллион выходных токенов делает многословные агентные циклы чувствительными к бюджету.
  • Большой контекст не гарантирует полного использования. Модель может пропускать детали, неверно связывать удалённые фрагменты и формировать правдоподобные, но неподтверждённые выводы.
  • Нет данных о локальном инференсе. Веса закрыты, поэтому в срезе отсутствуют показатели требований к собственной инфраструктуре.
  • Нет гарантии фактической точности. Высокий LMArena rating отражает предпочтения участников, а не проверку каждого утверждения по первичным источникам.

Как проверить на своей задаче

  1. Соберите закрытый набор. Возьмите 50–200 реальных запросов, включая редкие случаи, ошибки ввода, длинные документы и конфликтующие инструкции.
  2. Зафиксируйте режим. Запишите идентификатор модели, параметры thinking, температуру, лимит вывода, набор инструментов, регион и провайдера.
  3. Определите критерии. Отдельно измеряйте фактическую точность, полноту, соблюдение формата, качество ссылок, корректность вызовов функций и долю отказов.
  4. Замерьте задержку. Сохраняйте время до первого токена, время полного ответа и распределение результатов, а не только среднее значение.
  5. Посчитайте полную стоимость. Включите входные и выходные токены, повторы, инструментальные вызовы, кэш и проверку человеком.
  6. Проверьте длинный контекст. Разместите контрольные факты в начале, середине и конце материалов и потребуйте указать источник каждого вывода.
  7. Запускайте код. Используйте unit-тесты, интеграционные тесты, линтер и sandbox. Не оценивайте решение только по убедительности объяснения.
  8. Проведите слепое сравнение. Уберите названия моделей и попросите экспертов оценить ответы по заранее утверждённой рубрике.
  9. Повторите тест перед релизом. Preview-модель и параметры API могут измениться, поэтому старые результаты нельзя автоматически переносить на новую конфигурацию.

FAQ

Gemini 3.1 Pro Preview — открытая модель?

Нет. По паспорту это проприетарная модель Google с закрытыми весами. Наличие API и документации не делает её открытым ПО.

Можно ли использовать её в production?

Технически интеграция возможна, но версия имеет статус preview. Для production необходимы собственные проверки стабильности, резервная модель, контроль изменений API и приемлемые условия обслуживания.

Что означает COMRAD Score 78,4?

Это интегральная нормализованная редакционная оценка по шкале 0–100, объединяющая качество, человеческие предпочтения, код, эффективность и доступность. Это не процент правильных ответов.

Почему при суббалле предпочтений 100 модель находится на 22-м месте?

Итог зависит от пяти компонентов. Максимальный результат по предпочтениям сочетается с 39,4 по эффективности и 67,3 по коду, поэтому общий профиль не достигает верхних позиций.

Подходит ли модель для программирования?

Да, как помощник для анализа, генерации и рефакторинга кода. Но 51-е место в LMArena Code указывает, что изменения нужно обязательно проверять тестами и сравнением на собственном стеке.

Действительно ли контекст составляет миллион токенов?

В паспорте зафиксирован контекст 1 000 000 токенов, а официальная документация подтверждает класс окна около миллиона. Это лимит входа, а не гарантия одинаково точной работы с каждым фрагментом.

Быстро ли отвечает Gemini 3.1 Pro Preview?

После начала вывода скорость составляет 122,1 токена в секунду, но первый токен в измеренном срезе появлялся через 25,69 секунды. Для интерактивных сценариев начальная задержка может быть критичной.

Источники

Фактический срез статьи — 31 августа 2026 года. Числа рейтинга приведены исключительно по переданному паспорту COMRAD404. Официальные материалы Google описывают заявленные возможности продукта, тогда как Artificial Analysis, LMArena и редакционная методология дают отдельные независимые или производные измерения.