Запись архива

Gemini 3 Flash (thinking Minimal): профиль модели

Gemini 3 Flash с минимальным уровнем рассуждения занимает 60-е место: модель высоко оценивают пользователи, но её кодовый профиль заметно слабее. Разбираем цену, контекст, ограничения и сценарии выбора.

Профиль Gemini 3 Flash с режимом thinking Minimal, COMRAD Score 63,5 и разбором пяти суббаллов

Gemini 3 Flash (thinking Minimal) стоит выбирать для быстрых диалоговых, мультимодальных и инструментальных задач, где важнее отзывчивость, чем максимальная глубина рассуждения. Профиль модели неоднороден: высокий суббалл человеческих предпочтений соседствует со скромными оценками качества и программирования. Поэтому 60-е место и COMRAD Score 63,5 выглядят не как провал, а как следствие узкой настройки — минимизировать вычислительное рассуждение и быстрее переходить к ответу.

Важное уточнение: название в рейтинге описывает не отдельную архитектуру, а Gemini 3 Flash с параметром thinking_level="minimal". Официальная документация Google указывает, что этот уровень поддерживается моделью, но не гарантирует полного отключения рассуждения: на сложном запросе система всё равно может выполнить небольшой внутренний анализ.

Коротко

  • Место: 60-е в редакционном срезе COMRAD404 2026 H2.
  • COMRAD Score: 63,5 из 100 — нормализованная редакционная оценка, а не процент правильных ответов.
  • Главная сила: человеческие предпочтения — 95,3 из 100.
  • Главная слабость: программирование — 41,9 из 100.
  • Цена в паспорте: $0,50 за миллион входных и $3 за миллион выходных токенов.
  • Контекст: 1 048 576 токенов.
  • Скорость: измерений токенов в секунду и времени до первого токена в срезе нет.
  • Доступ: проприетарная модель Google без открытых весов.
  • Статус: паспорт содержит флаг preview=false, но официальный API идентифицирует точный endpoint как gemini-3-flash-preview. Для производственного внедрения следует ориентироваться на актуальный статус в документации провайдера.

Паспорт модели

Параметр Значение
Модель Gemini 3 Flash (thinking Minimal)
Разработчик Google
Место в рейтинге 60
COMRAD Score 63,5
Режим рассуждения Минимальный, рассуждение поддерживается
Лицензия Проприетарная
Открытые веса Нет
Контекст 1 048 576 токенов
Цена входа $0,50 за 1 млн токенов
Цена выхода $3 за 1 млн токенов
Уверенность профиля Средняя
Дата среза 31 августа 2026 года

Модель относится к семейству Gemini 3 Flash. Согласно официальной карточке Google DeepMind, базовая Gemini 3 Flash принимает текст, изображения, аудио и видео, а результатом служит текст. Там же она описана как мультимодальная reasoning-модель с уровнями thinking, регулирующими соотношение качества, задержки и стоимости.

Место в рейтинге

В редакционном выпуске рейтинга ИИ COMRAD404 за второе полугодие 2026 года конфигурация занимает 60-е место. Итоговая позиция рассчитана по методологии 1.0 с весами: качество — 40%, человеческие предпочтения — 30%, программирование — 15%, эффективность — 10%, доступность — 5%.

Основную поддержку результату даёт человеческое предпочтение. Его вклад в итоговую оценку составляет около 28,6 пункта. Качество добавляет 20 пунктов, программирование — около 6,3, эффективность — 6,2, доступность — 2,5. После округления получается COMRAD Score 63,5.

Такое распределение важно для выбора. Модель может нравиться участникам слепых сравнений благодаря ясности, структуре, тону или уместности ответа, но это не доказывает одинаково высокую надёжность на формальных тестах, сложном коде и многошаговых задачах. Место отражает весь профиль, а не одну сильную метрику.

Разбор пяти суббаллов

Суббалл Оценка Практическая интерпретация
Качество 50,0 Средний результат; независимого Artificial Analysis Intelligence Index в срезе нет.
Человеческие предпочтения 95,3 Очень сильный сигнал из слепых попарных сравнений текстовых ответов.
Программирование 41,9 Кодовые задачи требуют обязательной проверки тестами и более осторожного применения.
Эффективность 61,7 Умеренно сильное соотношение цены, режима рассуждения и доступных паспортных данных.
Доступность 50,0 API-доступ компенсируется проприетарностью и отсутствием открытых весов.

Все пять значений нормализованы редакцией в шкалу 0–100. Они не являются процентами качества, вероятностью правильного ответа или долей пройденных тестов. Сравнивать их напрямую с долларами, токенами в секунду или рейтингом LMArena некорректно.

Как читать результаты LMArena

В текстовой арене модель получила rating 1458,4, 52-е место и 85 940 голосов. Высокий объём голосования делает сигнал пользовательского предпочтения содержательным, хотя не превращает его в универсальную проверку фактической точности. LMArena строится на слепых попарных сравнениях: участник выбирает более удачный из двух ответов, после чего статистическая система обновляет рейтинг.

Для кода паспорт фиксирует rating 1383,0 и 79-е место. Разрыв между 52-м местом в текстовом режиме и 79-м в кодовом соответствует разнице редакционных суббаллов. Проще говоря, в обычном разговоре и генерации текста модель выглядит убедительнее, чем в задачах, где ответ должен компилироваться, проходить тесты и учитывать состояние большого проекта.

Нельзя трактовать rating 1458,4 как 1458 правильных ответов или как процент. Так же нельзя считать 85 940 голосов количеством уникальных пользователей либо числом решённых заданий: паспорт сообщает число голосов, но не даёт основания для более узкой интерпретации.

Возможности и сценарии

Минимальный уровень thinking рассчитан прежде всего на задачи с коротким путём от инструкции к результату. Он уместен там, где дополнительное размышление увеличивает стоимость и задержку, но редко меняет итог.

  • Диалоговые интерфейсы. Ответы службы поддержки, объяснение функций продукта, классификация обращения и подготовка черновика оператору.
  • Извлечение данных. Преобразование документов и сообщений в заданную структуру, если результат проверяется схемой и бизнес-правилами.
  • Суммаризация. Краткие пересказы переписок, заметок, транскриптов и длинных документов с заранее определённым форматом.
  • Контентные операции. Варианты заголовков, карточки товаров, адаптация тона, редактура и локализация черновиков.
  • Простые вызовы инструментов. Выбор функции, извлечение аргументов и маршрутизация запроса, когда число возможных действий ограничено.
  • Мультимодальный разбор. Вопросы по изображениям, аудио, видео и PDF — при условии, что конкретный API-провайдер поддерживает нужный тип входа.
  • Интерактивные подсказки. Сценарии, в которых пользователь ценит быстрый первый ответ и может запросить уточнение отдельным сообщением.

Менее удачный выбор — доказательства, сложная математика, архитектурные решения, автономное исправление больших репозиториев и исследовательские задачи с длинной цепочкой зависимостей. Для них минимальный thinking может преждевременно зафиксировать правдоподобный, но неполный ответ.

Качество ответа и человеческое предпочтение

Суббалл качества 50,0 — нейтральная середина профиля. Artificial Analysis Intelligence Index для этой конфигурации отсутствует, причём паспорт прямо отмечает, что значение не оценивалось редакцией взамен реального измерения. Поэтому делать вывод о её месте в этом индексе нельзя.

На этом фоне человеческое предпочтение 95,3 выглядит особенно заметно. Редакционная интерпретация такова: модель хорошо оптимизирована под воспринимаемое качество ответа — понятность, темп, форму и соответствие запросу. Но приятный ответ и проверяемо верный ответ — разные свойства. В рабочих процессах их нужно соединять с валидацией ссылок, чисел, JSON-схем, вычислений и фактов.

Практический риск состоит в том, что уверенно сформулированная ошибка может получить высокую субъективную оценку при быстром просмотре. Поэтому для юридических, медицинских, финансовых и иных решений с высокой ценой ошибки модель не должна быть единственным источником вывода.

Программирование

Кодовый суббалл 41,9, Code Arena rating 1383,0 и 79-е место задают осторожный режим применения. Gemini 3 Flash Minimal можно использовать как быстрый генератор локальных изменений: написать функцию по чёткой спецификации, объяснить исключение, создать тестовый шаблон, преобразовать формат данных или предложить небольшой рефакторинг.

Для самостоятельной работы с большим кодовым основанием одного ответа недостаточно. Модель следует помещать в контур с компилятором, линтером, статическим анализом и тестами. Особенно внимательно проверяйте зависимости, версии библиотек, обработку ошибок, безопасность входных данных и изменения публичных интерфейсов.

Минимальный thinking разумно применять на первом дешёвом проходе: классифицировать дефект, найти вероятный файл, составить план или подготовить патч. Если тесты не проходят либо задача затрагивает несколько подсистем, запрос стоит повторить с более глубоким уровнем рассуждения или направить другой конфигурации.

Цена и скорость

В зафиксированном паспорте указаны $0,50 за миллион входных токенов и $3 за миллион выходных. Это разные тарифные позиции: нельзя складывать их без учёта фактического объёма запроса и ответа. Например, стоимость короткого ответа определяет не только размер исходного документа, но и количество сгенерированных, включая тарифицируемые reasoning-токены по правилам конкретного API.

Для ориентировочного бюджета используйте формулу: (input_tokens / 1 000 000 × 0.50) + (output_tokens / 1 000 000 × 3.00). Затем добавьте расходы на повторные запросы, инструменты, поиск, кэширование и инфраструктуру, если они тарифицируются отдельно.

Чисел скорости в срезе нет: ни output tokens per second, ни time to first token не зафиксированы. Следовательно, называть модель быстрой в конкретных миллисекундах или обещать определённую пропускную способность нельзя. Официальное позиционирование Flash и режим Minimal указывают на приоритет низкой задержки, но это заявление разработчика, а не независимое измерение из паспорта.

Цена и задержка меняются в зависимости от провайдера, региона, стандартного или пакетного режима, размера контекста, нагрузки и использования инструментов. Перед запуском продукта перепроверьте действующий тариф и измерьте p50, p95 и p99 на собственном трафике.

Контекст и инструменты

Контекстное окно в паспорте составляет 1 048 576 токенов. Большой предел полезен для документов, журналов событий, транскриптов и репозиториев, но сам по себе не гарантирует одинаковой точности на любой позиции окна. Чем больше материалов передано, тем труднее модели отличить обязательное правило от фонового текста.

Официальная страница API указывает поддержку текста, изображений, видео, аудио и PDF на входе, текстовый вывод, function calling, structured outputs, code execution, кэширование, поиск, URL context и ряд других инструментов. Доступность функции может различаться между Gemini API, Vertex AI, тарифами и регионами, поэтому проверять её нужно для конкретной точки подключения.

Для длинного контекста полезнее не отправлять весь архив одним запросом, а сначала отфильтровать документы, добавить устойчивые идентификаторы фрагментов и потребовать ссылки на использованные части. Это снижает стоимость и упрощает аудит ответа.

Ограничения

  • Неоднозначный статус поставки. В переданном паспорте стоит preview=false, однако официальный идентификатор — gemini-3-flash-preview, а таблица прекращения поддержки относит его к preview-моделям и рекомендует Gemini 3.6 Flash как замену. Считать этот endpoint production-ready без отдельного подтверждения Google нельзя.
  • Нет Artificial Analysis Intelligence Index. Данных в срезе нет; восстанавливать индекс по другим метрикам нельзя.
  • Нет независимых данных о скорости. Невозможно количественно сравнить задержку и генерацию токенов.
  • Слабее кодовый профиль. Автоматически принимать патчи без запуска тестов не следует.
  • Minimal не означает «без рассуждения». Официальная документация допускает минимальное внутреннее рассуждение на сложных запросах.
  • Закрытые веса. Нельзя развернуть тот же набор весов в собственной инфраструктуре или независимо изучить его.
  • Проприетарные условия. Доступ, допустимое использование, хранение данных и жизненный цикл endpoint зависят от правил Google.
  • Большой контекст не равен идеальной памяти. Проверяйте извлечение фактов из начала, середины и конца входного массива.

Кому подойдёт модель

Конфигурация подходит командам, которым нужен недорогой первый проход по большому количеству запросов: чат, маршрутизация, суммаризация, извлечение полей, мультимодальные подсказки и подготовка черновиков. Особенно логична схема, где Gemini 3 Flash Minimal обрабатывает типовые случаи, а неоднозначные запросы автоматически переводятся на более глубокий уровень thinking или человеку.

Она менее убедительна как единственная модель для сложной разработки, автономного агента с широкими полномочиями или экспертного анализа без внешней проверки. Высокий суббалл предпочтения не компенсирует отсутствие Intelligence Index и сравнительно низкий кодовый результат.

Из-за preview-маркировки официального endpoint для долгоживущего продукта потребуется план миграции: зафиксированные тесты, слой абстракции над model ID, контроль изменений ответа и возможность быстро переключить версию.

Как проверить на своей задаче

  1. Соберите набор. Возьмите не менее 100 реальных запросов: типовые, длинные, неоднозначные, ошибочные и потенциально опасные.
  2. Зафиксируйте конфигурацию. Запишите model ID, провайдера, регион, дату, thinking_level="minimal", системную инструкцию, набор инструментов и лимит ответа.
  3. Определите критерии. Отдельно измеряйте фактическую точность, соблюдение формата, полноту, число повторов, отказов и инструментальных ошибок.
  4. Проведите слепую оценку. Не показывайте проверяющим название модели. Так легче отделить реальное предпочтение от ожиданий, связанных с брендом.
  5. Проверяйте код автоматически. Запускайте тесты, линтер, компилятор и анализ зависимостей для каждого патча.
  6. Измерьте задержку. Сохраните time to first token, полное время ответа и пропускную способность на p50, p95 и p99.
  7. Посчитайте фактическую цену. Учитывайте входные, выходные и reasoning-токены, повторы, кэш, инструменты и неуспешные вызовы.
  8. Сравните уровни thinking. Повторите трудную часть набора на Minimal и более глубоком режиме. Оцените, оправдывает ли прирост качества дополнительные расходы.
  9. Задайте пороги эскалации. Например, отправляйте запрос другой конфигурации при невалидном JSON, низкой уверенности, провале теста или конфликте источников.
  10. Повторяйте тест после обновлений. Preview-endpoint и управляемый API могут менять поведение без изменения вашей прикладной логики.

FAQ

Gemini 3 Flash (thinking Minimal) — отдельная модель?

В рамках профиля это конфигурация Gemini 3 Flash с минимальным уровнем thinking, а не подтверждённая отдельная архитектура. Официальный параметр thinking_level управляет допустимой глубиной рассуждения.

Означает ли Minimal полное отключение рассуждения?

Нет. Google прямо указывает, что Minimal не гарантирует отсутствия thinking: на сложном запросе модель может рассуждать в минимальном объёме.

Почему модель только на 60-м месте при суббалле предпочтения 95,3?

Итог учитывает пять направлений. Высокое человеческое предпочтение уравновешивают качество 50,0, программирование 41,9, эффективность 61,7 и доступность 50,0.

Подходит ли она для программирования?

Подходит для локальных и хорошо проверяемых задач, но кодовый профиль слабее текстового. Патчи необходимо прогонять через тесты, компилятор, линтер и проверку безопасности.

Сколько стоит использование?

Паспорт фиксирует $0,50 за миллион входных и $3 за миллион выходных токенов. Текущий счёт зависит от провайдера, режима, reasoning-токенов, инструментов и повторных вызовов.

Какова скорость генерации?

Независимых значений output tokens per second и time to first token в срезе нет. Скорость следует измерять на собственных запросах и выбранном API.

Можно ли развернуть модель локально?

Нет, веса не открыты. Модель распространяется как проприетарный сервис через продукты и API Google.

Готова ли точная версия к production?

Официальный endpoint называется gemini-3-flash-preview и указан в списке preview-моделей. Несмотря на флаг preview=false в рейтинговом паспорте, без актуального подтверждения Google называть его production-ready нельзя.

Источники

Рейтинговые числа приведены строго по паспорту COMRAD404 на 31 августа 2026 года. Динамические страницы провайдеров и бенчмарков могут показывать более новые значения.