Gemini 2.0 и Gemini 2.5 — это не просто две последовательные версии одной модели, а смена того, как Google описывает роль LLM в продукте. В материалах Google DeepMind за период с 11 декабря 2024 года по июль 2025 года акцент смещается от «мультимодальной модели» к семейству систем, рассчитанных на инструменты, длинный контекст, управляемое рассуждение и выполнение действий от имени пользователя. Для практиков здесь важен не маркетинговый ярлык agentic, а конкретные инженерные свойства: native tool use, live-мультимодальность, computer use, thinking budgets и продуктовые обвязки вокруг базовой модели.
Ниже — обзор именно исходных материалов Google DeepMind и связанных официальных model card/technical report. Это важно, потому что в случае Gemini 2.X версия модели, режим оценки и продуктовая оболочка менялись очень быстро, а без фиксации даты и варианта модели сравнение легко становится некорректным.
Коротко
- Gemini 2.0 Flash, объявленная 11 декабря 2024 года, стала базой для агентных сценариев Google: модель получила native tool use, live-мультимодальность и низкую задержку.
- Gemini 2.5 добавила новую ось масштабирования: не только качество базовой модели, но и управляемое «мышление» перед ответом. У 2.5 Pro это основной режим, у 2.5 Flash — гибридный режим с включаемым/выключаемым thinking и бюджетами.
- Google строит агентность не в одной модели, а в стеке: Project Astra для live-взаимодействия, Project Mariner для computer use в браузере, Jules для асинхронного кодинга, Deep Research для веб-исследований.
- Самый заметный количественный скачок в первоисточниках относится к Gemini 2.5 Pro, но даже внутри одной модели цифры нужно читать вместе с режимом оценки: single attempt, multiple attempts, custom agent setup и конкретной версией 03-25, 05-06 или GA.
- Google прямо признаёт, что агентные системы остаются уязвимы к indirect prompt injection; улучшения в Gemini 2.5 надо понимать как слой защиты, а не как окончательное решение.
Контекст: что Google называет «агентной эрой»
В декабрьском анонсе Gemini 2.0 Google DeepMind определила агентную эру как этап, где модель должна не только понимать ввод, но и «думать на несколько шагов вперёд» и выполнять действия под контролем пользователя. В тот же день компания показала не только саму Gemini 2.0 Flash, но и набор прототипов и инструментов вокруг неё: Project Astra, Project Mariner, Deep Research и новые developer-возможности для tool use и live API.
С инженерной точки зрения Gemini 2.0 Flash была переходной моделью между «умным мультимодальным ассистентом» и «оператором инструментов». В developer-анонсе Google заявила, что Flash 2.0 была вдвое быстрее Gemini 1.5 Pro при более сильной производительности, а model card от 15 апреля 2025 года повторяет ту же рамку: Gemini 2.0 Flash опережает Gemini 1.5 Pro на ключевых бенчмарках при удвоенной скорости. Это важный сигнал: агентность у Google с самого начала строилась не только на максимальном качестве, но и на latency-бюджете.
Дальше, уже весной 2025 года, логика семейства расщепляется. Gemini 2.5 Pro становится моделью для сложных задач с «мышлением» перед ответом, а Gemini 2.5 Flash — рабочей моделью, где это мышление можно дозировать или отключать. Иными словами, если Gemini 2.0 — это про доступ к инструментам и мультимодальному циклу, то Gemini 2.5 — про управление вычислением во время ответа как отдельным продуктовым и API-параметром.
Метод: из чего собрана линейка Gemini 2.X
1. Базовый слой: мультимодальность, длинный контекст, sparse MoE
Технический отчёт Gemini 2.5 и model card для 2.5 Pro описывают семейство Gemini 2.X как sparse mixture-of-experts Transformer с нативной мультимодальностью. Для практики это значит, что семейство изначально проектировалось не как «текстовая модель, к которой добавили картинки», а как единый стек для текста, изображений, аудио и видео.
У Gemini 2.5 Pro и 2.5 Flash Google фиксирует входное окно контекста в 1M токенов и выход до 64K токенов. Для Gemini 2.0 Flash в официальных материалах также фигурирует окно контекста порядка 1M токенов; model card указывает 1,048,576 токенов входа и текстовый вывод, а экспериментальные image outputs на дату публикации карты были ещё не полностью стабилизированы. Поэтому между 2.0 и 2.5 Google меняет не саму идею long context, а её роль: от расширенного понимания контента — к основе для агентных циклов поверх кода, видео, веб-страниц и документов.
2. Инструментальный слой: native tool use, code execution, search, MCP
Ключевая ставка Gemini 2.0 — native tool use. В developer-анонсе Google отдельно подчеркнула, что Gemini 2.0 обучена вызывать Google Search, code execution и сторонние функции через function calling. Это отличается от более раннего паттерна, где инструменты часто выглядели как внешний оркестратор вокруг модели; в Gemini 2.0 Google продвигает инструментальный вызов как базовую capability модели.
К маю 2025 года этот слой становится шире. На I/O Google объявила совместимость Gemini API и SDK с Model Context Protocol (MCP), а также перенос computer use-возможностей Project Mariner в Gemini API и Vertex AI. Практический смысл здесь простой: Google строит не одиночную «думающую» модель, а среду, где модель умеет планировать и обращаться к внешним системам по более стандартному интерфейсу.
3. Слой рассуждения: от fast non-thinking к controllable thinking
Вот главный сдвиг между 2.0 и 2.5. Gemini 2.0 Flash в официальных материалах описана прежде всего как быстрая, низколатентная, не-thinking модель для everyday tasks и real-time streaming. Gemini 2.5 Pro, наоборот, с марта 2025 года вводится как thinking model: модель должна выполнять внутренний этап рассуждения перед ответом.
Ещё важнее Gemini 2.5 Flash. В анонсе от 17 апреля 2025 года Google называет её первой fully hybrid reasoning model: thinking можно включать и выключать, а также задавать thinking budgets, то есть контролировать компромисс между качеством, стоимостью и задержкой. На практике это превращает «рассуждение» из скрытого свойства модели в управляемый параметр inference. Для агентных систем это особенно важно, потому что разные шаги одного и того же workflow требуют разной глубины вычисления: один вызов может быть проверкой UI-элемента, другой — планированием сложной последовательности действий.
4. Продуктовый слой: Astra, Mariner, Deep Research, Jules
Отдельная особенность Google — агентность здесь разворачивается сразу в продуктовых поверхностях. Project Astra был исследовательским прототипом «универсального AI-ассистента», а к I/O 2025 его camera и screen-sharing возможности уже начали встраиваться в Gemini Live. Project Mariner стартовал как браузерный computer-use прототип и к маю 2025 стал основой для Agent Mode и для developer-доступа через API.
Тот же принцип виден в Jules. В мае 2025 Google вывела Jules в public beta как асинхронного coding agent для GitHub-репозиториев и прямо связала его с Gemini 2.5 Pro. Это полезно держать в голове: когда Google говорит о «способностях Gemini», часть из них относится к базовой модели, а часть — к системе «модель + sandbox + инструменты + человек в цикле».
Результаты
Если свести материалы Google к инженерному минимуму, эволюция Gemini 2.X выглядит так:
| Модель | Историческая точка | Режим рассуждения | Контекст и вывод | Агентные свойства |
|---|---|---|---|---|
| Gemini 2.0 Flash | Объявлена 11.12.2024; model card опубликована 15.04.2025 | Быстрая non-thinking модель | Окно контекста 1M; текстовый вывод, image output на дату карты ещё экспериментален | Native tool use, Multimodal Live API, low-latency streaming |
| Gemini 2.5 Flash | Preview с 17.04.2025 | Hybrid reasoning: thinking можно включать, выключать и ограничивать бюджетом | 1M input, 64K output | Рабочая агентная модель с управлением cost/latency/quality; позже добавлены audio/computer-use расширения |
| Gemini 2.5 Pro | Experimental с 25.03.2025; к 27.06.2025 model card фиксирует GA | Thinking model; к I/O 2025 — также budgets и экспериментальный Deep Think | 1M input, 64K output | Ставка на сложное кодирование, reasoning, работу с большими репозиториями и тяжёлыми многошаговыми задачами |
Количественно Google сильнее всего подчёркивает прогресс в Gemini 2.5 Pro. Для версии Gemini 2.5 Pro Experimental (03-25) мартовский анонс указывает 18.8% на Humanity’s Last Exam без tool use и 63.8% на SWE-bench Verified с custom agent setup; те же значения повторяются в model card для варианта 03-25. Уже в model card от 27 июня 2025 года и в техническом отчёте от 2 июля 2025 года для GA-версии фигурируют 21.6% на Humanity’s Last Exam и 67.2% на SWE-bench Verified в режиме multiple attempts, тогда как single attempt для GA указан как 59.6%.
| Gemini 2.5 Pro | Experimental 03-25 | GA / отчёт середины 2025 | Что важно при чтении |
|---|---|---|---|
| Humanity’s Last Exam, без tool use | 18.8% | 21.6% | Это один из немногих случаев, где в официальных материалах есть близкое сравнение внутри одной линии 2.5 Pro |
| SWE-bench Verified | 63.8% с custom agent setup | 59.6% single attempt; 67.2% multiple attempts | Нельзя читать эти цифры как «простое падение или рост»: меняются scaffold, режим попыток и критерий отбора траекторий |
| Контекстное окно | 1M токенов | 1M токенов | В течение 2025 года long context остаётся не разовой демонстрацией, а базовым системным свойством |
Отсюда важный вывод для практики: главный результат Gemini 2.5 — не одна рекордная цифра, а перевод reasoning в управляемый ресурс. Именно поэтому 2.5 Flash и 2.5 Pro в документах Google описаны не как «быстрая» и «медленная» модели, а как два разных режима агентной работы: экономичный гибридный и максимально сильный thinking-first.
Интерпретация
Наш комментарий
На наш взгляд, «агентная эра Google» в случае Gemini — это не про появление автономного агента как одной новой сущности. Это про разведение обязанностей между уровнями системы.
- Gemini 2.0 создаёт базу: мультимодальный ввод, инструменты, live-взаимодействие, достаточная скорость.
- Gemini 2.5 Flash делает рассуждение настраиваемым, то есть пригодным для production-сценариев с бюджетом задержки и стоимости.
- Gemini 2.5 Pro становится тяжёлым когнитивным слоем для тех шагов, где нужен длинный план, сложное кодирование или работа с большим контекстом.
Это заметно отличает линию Gemini от более узких трактовок «агента» как браузерного оператора или coding bot. Google пытается собрать универсальный стек, который проходит через Search, Chrome, Android, Gemini app, API и Vertex AI. Сильная сторона такого подхода — унификация. Слабая — высокая сложность интерпретации: пользователю и разработчику труднее понять, где заканчивается способность модели и начинается способность всей системы.
Ограничения и критика
- Gemini 2.0/2.5 — это семейство, а не одна фиксированная модель. В официальных документах фигурируют варианты 03-25, 05-06, GA и более поздние обновления. Без привязки к версии любое сравнение быстро становится расплывчатым.
- Продуктовые демо не равны «чистой» модели. Gemini Live, Agent Mode, Jules и Deep Research — это не только базовый LLM, но и sandbox, policy-layer, права доступа, внешние сервисы и UX-ограничения.
- Бенчмарки в отчёте неоднородны. Технический отчёт Gemini 2.5 прямо предупреждает, что часть результатов для внешних моделей взята из self-reported источников, а для SWE-bench Verified разные провайдеры используют разный scaffolding. Это особенно важно для агентного кодинга.
- Безопасность не решена окончательно. В white paper по indirect prompt injection Google показывает улучшение устойчивости Gemini 2.5, но отдельно подчёркивает, что adversarial training не делает модель «иммунной» и что для реального развёртывания нужна defense-in-depth, а не только улучшенная базовая модель.
- Агентность всё ещё дорогая по вычислению и оркестрации. Сам факт появления thinking budgets — косвенное признание, что reasoning надо дозировать. Иначе production-агент легко становится слишком медленным или слишком дорогим.
Заключение
Если читать первоисточники без новостного шума, Gemini 2.0 и 2.5 — это история не про «очередную лучшую модель», а про перестройку интерфейса между моделью и действием. Gemini 2.0 дала Google мультимодальный, инструментальный и низколатентный фундамент; Gemini 2.5 добавила управляемое рассуждение и начала превращать этот фундамент в практический агентный стек.
Для разработчика главный вопрос теперь звучит не «насколько умна модель вообще», а «какой слой Gemini-стека нужен для конкретного шага: быстрый tool use, гибридное reasoning или тяжёлый Pro-режим с длинным планированием». Именно в этом, а не в одном бенчмарке, и состоит реальный смысл агентной эры Google.
Источники
- Introducing Gemini 2.0: our new AI model for the agentic era
- The next chapter of the Gemini era for developers
- Gemini 2.0 Flash – Model Card
- Gemini 2.5: Our newest Gemini model with thinking
- Start building with Gemini 2.5 Flash
- Gemini 2.5: Our most intelligent models are getting even better
- Google I/O 2025: From research to reality
- Project Astra — Exploring breakthrough capabilities for Google products — on the way to building a universal AI assistant
- Build with Jules, your asynchronous coding agent
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Gemini 2.5 Pro – Model Card
- Model cards — Google DeepMind
- Lessons from Defending Gemini Against Indirect Prompt Injections
FAQ
Gemini 2.0 и Gemini 2.5 — это две модели или два семейства?
Корректнее говорить о семействе 2.X. В документах Google фигурируют как минимум Gemini 2.0 Flash, 2.0 Flash-Lite, 2.5 Flash и 2.5 Pro, а внутри 2.5 Pro и 2.5 Flash есть отдельные версии и preview/GA-состояния.
Что у Google означает agentic на практике?
Не автономию «без человека», а сочетание модели с инструментами, длинным контекстом, планированием и возможностью выполнять действия под контролем пользователя. В продуктах это проявляется через Gemini Live, Agent Mode, Deep Research, Jules и computer use API.
Чем 2.5 Flash отличается от 2.5 Pro?
2.5 Flash — рабочая гибридная модель, где можно управлять thinking и его бюджетом ради цены и задержки. 2.5 Pro — более тяжёлая thinking-модель для сложного кодинга, reasoning и больших многошаговых задач.
Почему сравнивать цифры Gemini 2.0 и 2.5 сложно?
Потому что меняются не только веса модели, но и режимы оценки, версия бенчмарка, число попыток, tool-use setup и scaffolding. В случае agentic coding это особенно заметно на SWE-bench Verified.
