Запись архива

Gemini 2.5 Flash: обзор модели, рейтинг и цена API

Gemini 2.5 Flash — стабильная мультимодальная модель Google с контекстом 1 млн токенов и низкой ценой входа. Разбираем её место в рейтинге COMRAD404, метрики, сценарии и ограничения.

Gemini 2.5 Flash — мультимодальная модель Google с контекстом 1 млн токенов и API-инструментами

Gemini 2.5 Flash — практичная API-модель Google для больших объёмов мультимодальных запросов, где важны цена входных данных, длинный контекст и доступ к инструментам. В рейтинге COMRAD404 она занимает 86-е место с COMRAD Score 61,2. Это не профиль безусловного лидера: модель заметно сильнее выглядит по пользовательскому предпочтению, чем по сводной редакционной оценке качества, а независимый показатель скорости в переданном срезе отсутствует.

Главный аргумент в пользу Gemini 2.5 Flash — сочетание контекстного окна 1 048 576 токенов, поддержки текста, изображений, видео и аудио на входе, структурированных ответов, function calling, поиска и выполнения кода. Главный повод для осторожности — ограниченная уверенность редакционной оценки и отсутствие в срезе COMRAD404 данных Artificial Analysis, рейтинга LMArena по коду, скорости генерации и времени до первого токена.

Коротко

  • Для чего подходит: суммаризация больших документов, классификация, извлечение данных, мультимодальный анализ, агентные сценарии с инструментами и массовая обработка.
  • Что выделяет: контекст до 1 048 576 токенов, входные изображения, видео и аудио, поддержка поиска, выполнения кода, файлового поиска и вызова функций.
  • Стоимость из паспорта: 0,30 доллара за 1 млн входных токенов и 2,50 доллара за 1 млн выходных токенов.
  • Рейтинг COMRAD404: 86-е место, COMRAD Score 61,2 из 100.
  • Статистика LMArena: текстовый рейтинг 1409,8, 134-е место, 122 761 голос. Это рейтинг попарных сравнений, а не процент правильных ответов.
  • Статус: в паспорте модель отмечена как стабильная, не preview, с проприетарной лицензией и без открытых весов.

Официальная документация Google называет gemini-2.5-flash стабильной моделью и указывает поддержку thinking, однако в паспорте COMRAD404 поле reasoning имеет значение false. В этой статье флаг паспорта трактуется как редакционная классификация профиля, а не как утверждение, что API полностью лишён режима рассуждения.

Паспорт модели

Параметр Значение в срезе 31 августа 2026 года
Модель Gemini 2.5 Flash
Разработчик Google
Идентификатор gemini-2.5-flash
Лицензия Proprietary
Открытые веса Нет
Preview Нет
COMRAD404 86-е место; COMRAD Score 61,2
Уверенность оценки Ограниченная
Контекст 1 048 576 токенов
Выход До 65 536 токенов по официальной документации

Паспорт фиксирует именно модель Gemini 2.5 Flash, а не preview-вариант с отдельным суффиксом. Это важно для воспроизводимости: Google публиковала несколько промежуточных и preview-версий семейства 2.5, но в текущем профиле рассматривается стабильный идентификатор gemini-2.5-flash.

Место в рейтинге

86-я позиция означает, что Gemini 2.5 Flash находится в нижней части первой сотни моделей конкретного выпуска COMRAD404 — 2026 H2. Само место нельзя читать как универсальное утверждение о качестве во всех задачах: итоговая позиция зависит от методологии, состава доступных данных и весов суббаллов.

COMRAD Score модели равен 61,2 из 100. Это нормализованная редакционная оценка, а не вероятность правильного ответа и не процент успешных запросов. В формуле наибольший вес имеет качество — 0,4, затем человеческое предпочтение — 0,3, кодирование — 0,15, эффективность — 0,1 и доступ — 0,05. Поэтому заметно высокий показатель human preference не перекрывает средние значения quality и coding.

Независимое измерение LMArena в паспорте выглядит иначе: 1409,8 текстового рейтинга и 134-е место при 122 761 голосе. LMArena строится на слепых попарных сравнениях пользовательских ответов. Рейтинг отражает относительное предпочтение в этой среде, но не является тестом с заранее известными правильными ответами и не должен переводиться в «процент качества».

В переданном срезе нет Artificial Analysis Intelligence Index. Также нет LMArena Code rating и Code rank. Поэтому вывод о программировании опирается только на редакционный subscore coding 50,0 и официально заявленные возможности API, но не на отдельный независимый кодовый рейтинг.

Подробнее методологический контекст и положение модели можно проверить в общем рейтинге COMRAD404.

Разбор пяти суббаллов

Суббалл Оценка Вес Что это означает
Quality 50,0 0,40 Средняя редакционная оценка общего качества; именно этот показатель сильнее всего влияет на итог.
Human preference 81,9 0,30 Сильная сторона профиля: ответы часто получают высокое предпочтение в пользовательских сравнениях.
Coding 50,0 0,15 Средний редакционный уровень; отдельные данные LMArena по коду отсутствуют.
Efficiency 66,3 0,10 Хорошее сочетание цены и заявленной пригодности для массовой обработки, но фактическая скорость в паспорте не измерена.
Access 50,0 0,05 Нейтральная оценка доступности в редакционной шкале; она не означает бесплатность или одинаковые условия у всех провайдеров.

Самая заметная особенность таблицы — разрыв между human preference 81,9 и quality 50,0. Редакционная интерпретация такова: модель может хорошо восприниматься в диалоге и типовых пользовательских задачах, но этого недостаточно, чтобы считать её универсальным решением для сложных, точных или специализированных процессов.

Архитектура и статус

В официальной model card Gemini 2.5 Flash описывается как нативно мультимодальная transformer-модель с разреженной архитектурой mixture-of-experts. В документе также указано, что модель поддерживает текстовые, визуальные и аудиовходы, а для стандартного Gemini 2.5 Flash выдаёт текст.

Google объявила стабильную и общедоступную версию Gemini 2.5 Flash 17 июня 2025 года. В документации API стабильный идентификатор указан как gemini-2.5-flash; отдельная preview-версия gemini-2.5-flash-preview-09-2025 отмечена как закрытая. Поэтому статус «не preview» в паспорте соответствует рассматриваемому идентификатору.

Лицензия модели в паспорте — Proprietary. Открытых весов нет. Это означает, что пользователь получает доступ к модели через сервис Google или совместимый API-канал, но не может самостоятельно скачать веса, развернуть их на своей инфраструктуре и изменить условия использования так, как это возможно с рядом моделей с открытыми весами.

Возможности и сценарии

Документы и длинный контекст

Окно в 1 048 576 токенов делает модель интересной для обработки крупных наборов материалов: договоров, технических архивов, стенограмм, инструкций, баз знаний и коллекций тикетов. Практическая ценность зависит не только от номинального лимита, но и от того, насколько стабильно модель находит нужный фрагмент ближе к середине длинного входа. Поэтому длинный контекст следует проверять на собственных данных, а не считать миллион токенов гарантией безошибочного поиска.

Мультимодальный анализ

Официальная документация указывает приём текста, изображений, видео и аудио. Это позволяет строить разбор скриншотов, визуальную проверку документов, анализ видеосцен, расшифровок и смешанных пакетов данных. Выход стандартной модели — текст, поэтому генерацию изображений и аудио не следует приписывать именно этому endpoint.

Инструменты и агенты

Для API заявлены function calling, структурированные ответы, code execution, file search, search grounding, URL context и grounding с Google Maps. На практике это полезно для маршрутизации запросов, извлечения полей в JSON, поиска по прикреплённым материалам и последовательного вызова внутренних сервисов. Модель может быть компонентом агента, но агентный сценарий требует отдельного контроля циклов, разрешений инструментов, тайм-аутов и проверки результата.

Массовая обработка

Сочетание низкой цены входных токенов и контекстного окна подходит для классификации, дедупликации, кратких резюме, разметки обращений и первичного анализа больших коллекций. Для задач, где каждый ответ влияет на деньги, доступ или юридическое решение, модель лучше использовать как первый этап конвейера с последующей валидацией.

Цена и скорость

В паспорте указана цена 0,30 доллара за 1 млн входных токенов и 2,50 доллара за 1 млн выходных токенов. Это разные единицы тарификации: стоимость входа нельзя сравнивать с ценой выхода как с одинаковыми величинами. Для расчёта бюджета нужно оценить долю длинных входов, средний объём ответа, повторное использование контекста, кэширование и выбранный режим обработки.

Пример: запрос с 100 000 входных токенов и 5 000 выходных токенов при указанных ставках даёт ориентировочную стоимость 0,0425 доллара до учёта специальных режимов и условий провайдера. Это арифметическая иллюстрация тарифной структуры, а не обещание конечного счёта.

Output tokens per second и time to first token в паспорте отсутствуют. Поэтому нельзя честно назвать Gemini 2.5 Flash конкретное число токенов в секунду или фиксированную задержку. Скорость зависит от API-провайдера, региона, нагрузки, размера запроса, включённых инструментов и режима inference. В документации Google для модели перечислены Batch API, Flex inference и Priority inference, но наличие режима не превращает его в неизменную характеристику производительности.

Для предварительного бюджета используйте формулу: стоимость = входные токены / 1 000 000 × 0,30 + выходные токены / 1 000 000 × 2,50. Затем добавьте стоимость внешнего поиска, хранения, вызовов инструментов и повторных запросов, если они присутствуют в архитектуре приложения.

Ограничения

Главное ограничение для оценки — неполная независимая метрика в паспорте. Artificial Analysis Intelligence Index отсутствует, кодовый рейтинг LMArena отсутствует, а параметры скорости не измерены. Это снижает уверенность в сравнении модели по интеллекту, программированию и задержке.

Model card Google прямо указывает общие ограничения foundation-моделей: галлюцинации, слабости в причинном понимании, сложной логической дедукции и контрфактических рассуждениях. В документе также отмечено, что соблюдение заданных thinking budgets может быть непоследовательным. Следовательно, параметр бюджета рассуждений не следует считать точным регулятором времени, стоимости или глубины каждого ответа.

Заявленный knowledge cutoff — январь 2025 года. Для текущих цен, законов, расписаний, новостей, доступности товаров и других изменяемых сведений потребуется grounding, поиск или собственная актуальная база. Даже при подключённом поиске источники и цитаты следует проверять отдельно.

Модель проприетарная, а её API зависит от политики и инфраструктуры Google. Нужно заранее проверить квоты, лимиты запросов, правила хранения данных, требования к региону, поведение при исчерпании бюджета и порядок уведомления об изменениях или выводе версий.

Кому стоит выбрать Gemini 2.5 Flash

Модель рационально рассматривать, если основная нагрузка состоит из повторяемых мультимодальных операций, а стоимость входного контекста критична. Хорошие кандидаты — внутренний поиск по документам, обработка клиентских обращений, массовое извлечение данных, визуальная проверка, подготовка черновиков и tool-using ассистенты.

Gemini 2.5 Flash менее очевидный выбор для задач, где требуется подтверждённый максимум качества, сложная автономная разработка программного обеспечения или строгая воспроизводимость локального развёртывания. В таких случаях следует сначала провести собственный тест: паспорт не содержит достаточных независимых данных, чтобы закрыть эти вопросы одной строкой рейтинга.

Как проверить на своей задаче

  1. Соберите реальную выборку. Возьмите 50–200 обезличенных запросов из production или ручного процесса. Разделите их на типы: короткий текст, длинный документ, изображение, видео, аудио, JSON и вызов инструмента.
  2. Зафиксируйте критерии. Для каждого типа заранее определите точность, полноту, формат, допустимую длину ответа, долю выдуманных фактов и правила отказа.
  3. Проверьте длинный контекст. Размещайте контрольный факт в начале, середине и конце документа. Измеряйте не только наличие ответа, но и правильность ссылки на источник.
  4. Разделите thinking-режимы. Если используете thinking, отдельно записывайте качество, стоимость и задержку. Не предполагайте, что бюджет одинаково влияет на все классы задач.
  5. Протестируйте инструменты. Дайте модели намеренно неоднозначные запросы, ошибки API, пустые результаты поиска и конфликтующие данные. Проверяйте, умеет ли приложение безопасно остановить цикл.
  6. Посчитайте экономику. Замерьте фактические входные и выходные токены, долю повторных запросов и стоимость неуспешных попыток. Сравнивайте не цену одного промпта, а стоимость полезно обработанного объекта.
  7. Проведите регрессию. Сохраните эталонные ответы и повторяйте тест после изменения версии, провайдера, системной инструкции или схемы инструментов.

Минимальный отчёт по пилоту должен включать p50 и p95 задержки, долю успешных структурированных ответов, factuality на проверяемых полях, стоимость на один обработанный документ и процент ручных исправлений. Эти показатели дополняют рейтинг и показывают, подходит ли модель именно вашему процессу.

FAQ

Gemini 2.5 Flash — reasoning-модель или нет?

В паспорте COMRAD404 флаг reasoning установлен в false, поэтому в редакционной классификации модель не отмечена как reasoning-модель. При этом официальная документация Google указывает поддержку thinking, а model card описывает Gemini 2.5 Flash как гибридную reasoning-модель с возможностью включать или выключать thinking. Эти утверждения относятся к разным слоям описания и не должны смешиваться.

Какое место Gemini 2.5 Flash занимает в рейтинге COMRAD404?

В выпуске 2026 H2 модель занимает 86-е место с COMRAD Score 61,2 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.

Что означает рейтинг LMArena 1409,8?

Это статистический рейтинг текстовых попарных сравнений. В паспорте также указаны 134-е место и 122 761 голос. Значение 1409,8 нельзя интерпретировать как 1409,8 балла из 100 или как процент успешных ответов.

Сколько стоит Gemini 2.5 Flash?

В зафиксированном паспорте указаны 0,30 доллара за 1 млн входных токенов и 2,50 доллара за 1 млн выходных токенов. Итоговая сумма зависит от объёма запросов, режима API, кэширования и условий конкретного провайдера.

Какая скорость генерации у модели?

В срезе нет данных о output tokens per second и time to first token. Называть фиксированную скорость нельзя; её нужно измерить на выбранном API-провайдере и вашем типе нагрузки.

Можно ли развернуть модель локально?

Нет оснований считать это возможным: в паспорте указана проприетарная лицензия и отсутствие открытых весов. Модель следует рассматривать как сервисный API, а не как пакет для самостоятельного локального запуска.

Источники

  • Gemini 2.5 Flash — официальная документация Gemini API — идентификатор модели, лимиты токенов, поддерживаемые входы, инструменты, стабильный статус и дата обновления документации.
  • Google: We’re expanding our Gemini 2.5 family of models — объявление общей доступности стабильных Gemini 2.5 Flash и Pro от 17 июня 2025 года.
  • Google: Gemini 2.5 Flash is now in preview — исходное официальное описание гибридного reasoning-подхода, thinking и бюджетов рассуждений.
  • Gemini 2.5 Flash Model Card — архитектура, мультимодальные входы, контекст, официальные ограничения, knowledge cutoff и сведения о безопасности.
  • LMArena Text Leaderboard — источник текстового рейтинга попарных сравнений; числовые значения в статье взяты из переданного паспорта COMRAD404.
  • Artificial Analysis: LLM Leaderboard — справочная страница независимого бенчмарка; Intelligence Index в переданном срезе для этой модели отсутствует.