Gemini 3.5 Flash High — практичная модель Google для длинных документов, мультимодальных запросов и агентных сценариев, но не универсальный лидер для сложной разработки. В редакционном срезе COMRAD404 она занимает 21-е место с COMRAD Score 79,2. Главный аргумент в её пользу — сочетание максимального нормализованного балла human preference, большого контекста и скорости генерации 205 токенов в секунду. Главный компромисс виден в кодовом рейтинге LMArena: 37-е место, а также в суббалле эффективности — 56,8 из 100.
Ниже «High» рассматривается как обозначение профиля с повышенным уровнем рассуждений. В официальной документации Google модель представлена как gemini-3.5-flash, а уровень high задаётся параметром thinking_level. Это важно: название из паспорта рейтинга не следует автоматически считать отдельным публичным API-идентификатором.
Коротко
- Итоговая оценка COMRAD404: 79,2 из 100.
- Позиция: 21-е место в выпуске 2026 H2.
- Разработчик: Google.
- Тип доступа: проприетарная модель, open weights отсутствуют.
- Рассуждения: поддерживаются; уровень
highориентирован на сложные задачи, математику, код и многошаговые действия. - Контекст: 1 000 000 токенов.
- Стоимость в паспорте: 1,50 доллара за 1 млн входных токенов и 9,00 доллара за 1 млн выходных токенов.
- Скорость в паспорте: 205 выходных токенов в секунду; time to first token — 14,68 секунды.
Официальные материалы Google описывают Gemini 3.5 Flash как нативно мультимодальную reasoning-модель для агентных рабочих процессов, программирования и задач с длинным горизонтом. Независимая часть профиля в этом материале — значения LMArena и Artificial Analysis из переданного паспорта; COMRAD Score и пять суббаллов являются редакционными нормализованными оценками, а не процентом правильных ответов.
Идентичность модели и статус доступа
Модель разработана Google и имеет проприетарную лицензию. В паспорте указано, что open weights отсутствуют, поэтому развернуть её как обычный локальный пакет на собственном оборудовании нельзя. Практический путь — использовать доступные продукты и API-каналы Google либо провайдера, который предлагает эту модель на своих условиях.
Статус модели в паспорте — не preview. При этом это не означает, что все функции, режимы инференса и тарифы одинаковы во всех интерфейсах. Официальная карточка Google указывает стабильный идентификатор gemini-3.5-flash, мультимодальные входы для текста, изображений, видео, аудио и PDF, а также текстовый вывод. В ней отдельно перечислены поддержка function calling, Search grounding, Google Maps grounding, File Search, URL context, code execution, structured outputs и thinking.
Уровень рассуждений управляется отдельно. В документации Google для Gemini 3.5 Flash перечислены режимы minimal, low, medium и high; по умолчанию используется medium, а high предназначен для наиболее трудных задач. Поэтому результаты, цена и задержка конкретного запроса зависят не только от названия модели, но и от выбранного уровня thinking, типа API и режима обслуживания.
Паспорт модели
| Параметр | Значение в срезе 31 августа 2026 года |
|---|---|
| Модель | Gemini 3.5 Flash High |
| Канонический API-slug | gemini-3.5-flash |
| Организация | |
| Лицензия | Proprietary |
| Open weights | Нет |
| Рассуждения | Да |
| Preview | Нет |
| COMRAD Score | 79,2 из 100 |
| Artificial Analysis Intelligence Index | 46,7; значение отмечено как estimated |
| LMArena Text | 1478,8; 21-е место; 32 174 голоса |
| LMArena Code | 1501,1; 37-е место |
| Цена | $1,50 за 1 млн входных токенов; $9,00 за 1 млн выходных токенов |
| Скорость | 205 выходных токенов/с; TTFT 14,68 с |
| Контекст | 1 000 000 токенов |
Числа в таблице относятся именно к редакционному срезу, а не к гарантированным значениям на весь срок эксплуатации модели. Цена, скорость и доступность функций могут меняться в зависимости от API-провайдера, тарифа, региона, нагрузки и режима инференса.
Место в рейтинге
21-я позиция ставит Gemini 3.5 Flash High в верхнюю часть рейтингового поля, но не делает её безусловно лучшим выбором для любой задачи. COMRAD404 рассчитывает итоговый балл с весами: качество — 40%, human preference — 30%, coding — 15%, эффективность — 10%, доступность — 5%. В таком профиле особенно заметно влияние пользовательских предпочтений и общего качества, тогда как стоимость и скорость не могут полностью компенсировать результаты на кодовых задачах.
Текстовый LMArena rating 1478,8 и 21-е место получены методом слепых попарных сравнений. Это статистический рейтинг предпочтений пользователей, а не доля правильных ответов. Число 32 174 голоса делает результат содержательным индикатором восприятия в текстовом диалоге, но не заменяет прикладной тест на собственных данных.
Кодовый LMArena rating равен 1501,1, однако в кодовой арене модель находится на 37-м месте. Разрыв между текстовой и кодовой позициями — важная часть профиля. Он не доказывает, что Gemini 3.5 Flash High плохо программирует, но показывает: её сильные стороны в общей полезности, диалоге, мультимодальности и агентных сценариях не следует механически переносить на автономную разработку сложных программных систем.
Профиль пяти суббаллов
| Суббалл | Оценка | Редакционная интерпретация |
|---|---|---|
| Quality | 75,1 из 100 | Высокий общий уровень, достаточный для широкого набора рабочих задач, но без основания считать модель одинаково сильной во всех доменах. |
| Human preference | 100,0 из 100 | Максимальная нормализованная оценка предпочтений в данной методике; это не 100% качества и не гарантия безошибочности. |
| Coding | 64,9 из 100 | Самый заметный содержательный компромисс профиля; для программирования нужен собственный набор регрессионных тестов. |
| Efficiency | 56,8 из 100 | Стоимость, задержка и скорость дают смешанную картину: генерация быстрая, но первый токен появляется не мгновенно. |
| Access | 74,8 из 100 | Модель доступна через экосистему Google, однако закрытая лицензия и зависимость от провайдера ограничивают контроль над размещением. |
Суббаллы — редакционная шкала 0–100. Их нельзя читать как вероятности, проценты успешных ответов или прямые результаты одного теста. Максимальный human preference отражает место модели в нормализованном сравнении, а не универсальное превосходство над любым конкурентом.
Возможности и сценарии
Длинные документы. Контекст в 1 млн токенов подходит для анализа больших коллекций материалов: договоров, технической документации, исследовательских архивов, журналов событий и репозиториев. На практике размер окна не равен гарантии точного извлечения любой детали. При работе с длинным вводом нужно проверять поиск по нескольким фрагментам, устойчивость ссылок на страницы и способность модели не смешивать похожие сущности.
Мультимодальный разбор. Официальная карточка указывает поддержку текста, изображений, видео, аудио и PDF на входе. Это делает модель удобной для обработки скриншотов интерфейсов, таблиц, счетов, презентаций, видеосцен и голосовых материалов в одном рабочем процессе. Для критичных документов распознавание следует дополнять извлечением исходных полей и проверкой человеком.
Агентные цепочки. Function calling, code execution, Search grounding, File Search, URL context и structured outputs позволяют строить не только чат, но и конвейер: принять запрос, найти данные, вызвать инструмент, проверить результат и вернуть структурированный ответ. Google также заявляет встроенную поддержку computer use для действий в браузере, на мобильных и настольных средах. Это полезно для тестирования интерфейсов и автоматизации рутинных операций, но необратимые действия нельзя оставлять без подтверждения пользователя.
Программирование и рефакторинг. Сильный сценарий — итеративная работа: объяснить ошибку, предложить патч, запустить тест, разобрать лог и повторить цикл. Результат лучше, когда модель получает узкий контекст, критерии готовности и доступ к инструментам. Для самостоятельного проектирования большой системы, сложной оптимизации или кода без тестов следует учитывать кодовый суббалл 64,9 и позицию 37 в Code Arena.
Повседневные тексты. Текстовый рейтинг и максимум human preference делают модель привлекательной для черновиков, суммаризации, редактуры, классификации и диалоговых интерфейсов. При этом для фактов после января 2025 года официальная документация рекомендует использовать Search Grounding: заявленный cutoff знаний нельзя путать с актуальностью подключённого поиска.
Цена и скорость
В переданном паспорте указаны $1,50 за 1 млн входных токенов и $9,00 за 1 млн выходных токенов. Для грубой оценки запроса с 100 000 входных и 10 000 выходных токенов это составляет около $0,24 по указанным ставкам, без учёта кэширования, поиска, инструментов, специальных режимов и возможных тарифов провайдера. Расчёт иллюстративный: фактический счёт зависит от того, как API считает thinking tokens и дополнительные операции.
Скорость вывода в срезе — 205 токенов в секунду. Это показатель генерации после начала выдачи, а не время полного ответа. Time to first token равен 14,68 секунды и потому может сильнее влиять на ощущение отзывчивости в интерактивном интерфейсе. Для коротких ответов TTFT имеет больший вес, чем максимальная скорость потока; для длинных ответов важнее становится совокупность TTFT и output tokens per second.
Google публикует разные варианты обслуживания — стандартный, batch, flex и priority — и предупреждает, что стоимость зависит от выбранного режима. В паспорте зафиксированы только конкретные значения для рейтингового среза, поэтому их нельзя трактовать как неизменный прайс-лист. Перед запуском продукта нужно проверить актуальную страницу тарификации и отдельно посчитать расходы на grounding, кэширование и повторные вызовы инструментов.
Ограничения
- Закрытая модель. Нет open weights и локального автономного развёртывания, поэтому команда зависит от политики Google, доступности API и условий провайдера.
- Неравномерный профиль. Текстовое положение значительно лучше кодового. Если основная задача — генерация и сопровождение программного кода, общий COMRAD Score недостаточен для выбора.
- Задержка первого токена. 14,68 секунды может быть заметным ограничением для коротких чатовых ответов, особенно при включённом интенсивном рассуждении или использовании инструментов.
- Динамика тарифа. Цена и скорость зависят от режима, нагрузки, API и поставщика. Нельзя закладывать паспортное значение без проверки контракта и измерений.
- Computer use не равен безрисковой автоматизации. Google отдельно указывает на prompt injection и рекомендует подтверждение чувствительных действий, sandboxing, human-in-the-loop и строгий контроль доступа.
- Актуальность знаний. В документации указан cutoff января 2025 года. Для свежих данных требуется подключение поиска и проверка источников.
- Есть функциональные пробелы. В карточке Google не заявлены генерация изображений, генерация аудио и Live API; сегментация изображений в документации Gemini 3.x указана как неподдерживаемая.
Данных о размере модели, числе параметров и внутренней полной архитектуре в переданном паспорте нет. Официальная карточка говорит, что Gemini 3.5 Flash основана на Gemini 3 Flash, но не даёт оснований восстанавливать размер или детали реализации по памяти.
Кому подойдёт модель
Gemini 3.5 Flash High разумно рассматривать командам, которым нужен один API для документов, изображений, вызова инструментов и многошаговой логики. Особенно уместны внутренние помощники с поиском по базе знаний, анализ больших PDF, обработка мультимедийных обращений, UI-тестирование, подготовка структурированных черновиков и агентные прототипы.
Модель менее очевидна для проекта, где решающими являются локальное развёртывание, воспроизводимость весов, минимальная задержка короткого ответа или максимально стабильная кодогенерация. В таких случаях сначала нужно измерить именно целевую метрику, а не ориентироваться на 21-е место в общем рейтинге.
Как проверить на своей задаче
- Соберите репрезентативный набор. Возьмите 30–100 реальных запросов: простые, пограничные и аварийные случаи. Не ограничивайтесь демонстрационными примерами.
- Разделите задачи по типам. Отдельно измеряйте тексты, документы, изображения, код, tool calling и длинный контекст. Общий средний балл может скрыть провал в одном критичном классе.
- Зафиксируйте режим. Запишите API-провайдера, версию идентификатора, thinking level, системный промпт, температуру или заменяющие параметры, если они поддерживаются.
- Проверьте факты и формат. Считайте не только субъективную полезность, но и точность извлечения, валидность JSON, соблюдение схемы, наличие выдуманных утверждений и устойчивость к длинному контексту.
- Для кода запускайте тесты. Оценивайте не красоту патча, а прохождение unit-, integration- и security-тестов, отсутствие регрессий и количество ручных итераций.
- Измерьте экономику. Запишите input/output tokens, число вызовов инструментов, TTFT, полное время ответа и стоимость на успешный результат. Цена одного запроса без стоимости исправлений может вводить в заблуждение.
- Добавьте проверки безопасности. Для computer use тестируйте prompt injection, права доступа, подтверждение платежей, удаление данных и остановку агента при неоднозначном результате.
Тестовый минимум: 40 реальных запросов, 10 длинных документов, 10 задач на код,
10 мультимодальных примеров, 10 вызовов инструментов; три повтора каждого
критичного сценария с фиксацией точности, задержки и стоимости.
После такого теста сравнивайте модель с собственным порогом пригодности: например, не менее 95% валидных структурированных ответов, отсутствие критичных ошибок в документах и укладывание в бюджет на успешный кейс. Эти пороги должна определить команда, поскольку паспорт не содержит универсального production SLA.
Вердикт COMRAD404
Gemini 3.5 Flash High получает сильную позицию благодаря сочетанию пользовательского восприятия, мультимодальности, миллионного контекста и высокой скорости генерации. Это хороший кандидат на роль универсального рабочего слоя для агентных процессов, особенно если инфраструктура уже построена вокруг Google API.
Но рейтинг также показывает границы модели. 21-е место в тексте не отменяет 37-го места в Code Arena, а 205 токенов в секунду не отменяют TTFT 14,68 секунды. Поэтому лучший способ выбора — использовать Gemini 3.5 Flash High как модель для длинного контекста, инструментов и быстрых итераций, а решение о закупке принимать после измерения кода, задержки, стоимости и частоты ошибок на собственных данных.
Полная позиция модели и методика выпуска доступны в рейтинге COMRAD404. Все числовые значения этой статьи относятся к срезу на 31 августа 2026 года.
FAQ
Что означает «High» в названии Gemini 3.5 Flash High?
В паспорте рейтинга это обозначение профиля с повышенным уровнем рассуждений. В официальной документации Google публичный идентификатор указан как gemini-3.5-flash, а уровень high выбирается через параметр thinking_level. Не следует автоматически считать «High» отдельной моделью с другим API-slug.
Можно ли считать COMRAD Score 79,2 процентом качества?
Нет. COMRAD Score и пять суббаллов — нормализованные редакционные оценки по шкале от 0 до 100. Они предназначены для сопоставления профилей моделей и не означают вероятность правильного ответа.
Что означает рейтинг LMArena 1478,8?
Это статистический рейтинг по слепым попарным сравнениям в текстовой арене. Он отражает предпочтения участников сравнений, а не процент правильных ответов. В паспорте также указано 32 174 голоса и 21-е место.
Подходит ли Gemini 3.5 Flash High для программирования?
Подходит для итеративного написания, отладки, рефакторинга и работы с инструментами, но профиль не является безусловно кодовым: LMArena Code показывает 37-е место, а coding суббалл равен 64,9 из 100. Для критичного кода необходимы тесты и собственная оценка.
Какой у модели контекст?
В рейтинговом паспорте зафиксирован контекст 1 000 000 токенов. Официальная карточка Google также указывает входное окно до 1 млн токенов и текстовый вывод до 64 тыс. токенов.
Сколько стоит Gemini 3.5 Flash High?
В паспорте указаны $1,50 за 1 млн входных токенов и $9,00 за 1 млн выходных токенов. Это значение среза, а не обещание постоянной цены. Финальный счёт зависит от провайдера, режима, thinking tokens, кэширования, grounding и вызовов инструментов.
Есть ли у модели open weights?
Нет. В паспорте указана проприетарная лицензия и отсутствие open weights. Модель используется через продукты и API-каналы, а не как свободно распространяемый локальный пакет.
Источники
- Gemini 3.5 Flash — официальная документация Google AI for Developers — подтверждает API-идентификатор, входные типы, контекст, поддерживаемые функции и статус стабильной версии.
- Gemini 3.5 Flash Model Card — Google DeepMind — подтверждает мультимодальность, reasoning foundation, контекст 1 млн токенов, выход до 64 тыс. токенов, назначение и ограничения.
- What’s new in Gemini 3.5 Flash — Google AI for Developers — подтверждает уровни thinking, сохранение промежуточного reasoning-контекста, инструменты и рекомендации по выбору режима.
- Официальный анонс Gemini 3.5 Flash — Google — подтверждает разработчика, дату представления, заявленные агентные и кодовые сценарии, а также каналы доступности.
- Computer use in Gemini 3.5 Flash — Google — подтверждает встроенный computer use и рекомендации по подтверждению чувствительных действий, sandboxing и защите от prompt injection.
- Gemini Developer API pricing — Google AI for Developers — подтверждает, что тарифы зависят от типа обслуживания, а batch, flex и priority имеют отдельные условия.
- Artificial Analysis: LLM Leaderboard — источник метрик Artificial Analysis, цены, скорости, контекста и API-функций, использованных в зафиксированном паспорте.
- LMArena Text Leaderboard — источник текстового рейтинга, позиции и числа пользовательских голосов, использованных в паспорте.
- LMArena Leaderboard — источник результатов Code Arena, использованных при расчёте кодового суббалла.
