Запись архива

Gemini 1.5 и окно в 1–10 млн токенов: что это значило на практике

Разбираем исторический срез Gemini 1.5 в 2024 году: что Google DeepMind реально открыла разработчикам, где заканчивался продуктовый лимит и где начинался исследовательский стресс-тест на 10 млн токенов.

Схема работы Gemini 1.5: мультимодальный вход, длинное окно контекста, MoE-маршрутизация, context caching и текстовый ответ

Gemini 1.5 — семейство моделей Google DeepMind, анонсированное 15 февраля 2024 года, где длинный контекст стал не побочной характеристикой, а центральной частью продукта. Вокруг модели быстро закрепилась формула «от 1 до 10 миллионов токенов», но в официальных материалах эти числа означали разные вещи: 1 млн и затем 2 млн — это уровни доступного окна контекста для разработчиков, а 10 млн — исследовательский предел в стресс-тестах. Этот текст сознательно ограничен срезом 2024 года: анонсами Google и техническим отчётом Gemini 1.5, без подмены темы более новыми релизами Gemini 2.x и 3.x.

Для практиков это важное различие. Если смотреть только на заголовок про «10 миллионов», можно переоценить реальную продуктовую доступность; если смотреть только на API-лимит, можно недооценить, насколько далеко Google пыталась протянуть само понимание длинного контекста в исследованиях.

Коротко

  • В официальных материалах 2024 года у Gemini 1.5 было не одно, а несколько «окон»: 128 тысяч токенов по умолчанию на старте, 1 млн в превью, затем 2 млн для разработчиков и до 10 млн в исследовательских тестах.
  • Ключевая техническая ставка — не только на длину окна, но и на разреженную архитектуру MoE и мультимодальность: в один контекст можно подавать текст, код, изображения, видео и аудио.
  • 10 млн токенов в материалах Google 2024 года — это не «обычный режим API», а верхняя граница исследовательской проверки retrieval-поведения и next-token prediction.
  • Длинный контекст не равен гарантированному пониманию всего входа. И сам техотчёт Google, и независимые работы по long-context показывают: между «модель может принять много токенов» и «модель надёжно использует их в сложной задаче» есть заметная разница.
  • Практический вывод: для инженерии важнее не мифическое число само по себе, а связка из окна контекста, кэширования контекста, хороших evals и, при необходимости, retrieval-слоя.

Контекст: откуда взялась формула «1–10 млн токенов»

Исторически здесь важно разделить анонс, доступность и исследовательский потолок. В феврале 2024 года Google одновременно выпустила публичный анонс Gemini 1.5 и отдельный developer-пост для Google AI Studio. В обоих источниках фигурировали две цифры: 128 тысяч токенов по умолчанию и 1 миллион токенов как экспериментальное длинное окно в Private Preview. В том же февральском анонсе Google отдельно написала, что в исследованиях успешно тестировала до 10 миллионов токенов.

Дата Что было заявлено Какой был статус
15 февраля 2024 Gemini 1.5 Pro: 128k по умолчанию, до 1 млн токенов в экспериментальном режиме; отдельно сказано про тесты до 10 млн токенов. Источники: Introducing Gemini 1.5, Google’s next-generation AI model, Gemini 1.5: Our next-generation model, now available for Private Preview in Google AI Studio. Private Preview для части разработчиков и enterprise-клиентов.
14 мая 2024 Google объявила публичное превью 1 млн токенов для Gemini 1.5 Pro и 1.5 Flash; для 1.5 Pro отдельно анонсировала 2 млн токенов в private preview / waitlist. Источники: Gemini 1.5 Pro updates, 1.5 Flash debut and 2 new Gemma models, Get more done with Gemini: Try 1.5 Pro and more intelligent features. 1 млн — public preview; 2 млн — ограниченный доступ по листу ожидания.
27 июня 2024 Для Gemini 1.5 Pro открыт доступ к 2 млн токенов для всех разработчиков; одновременно запущен context caching. Источники: Gemini 1.5 Pro 2M context window, code execution capabilities, and Gemma 2 are available today, Gemini 1.5 Pro updates, 1.5 Flash debut and 2 new Gemma models. 2 млн — developer access; caching — часть API-практики для длинного контекста.

Отсюда главный тезис: верхняя цифра «10 млн» в разговоре о Gemini 1.5 относится к исследовательской валидации, а не к стандартной продуктовой конфигурации в 2024 году. Это прямо видно, если читать февральский анонс Google вместе с техотчётом Gemini 1.5, а не только пересказы.

Метод: как Gemini 1.5 делает длинный контекст практичным

На базовом уровне окно контекста — это объём входа, который модель может держать «перед собой» во время генерации. Для больших языковых моделей это не то же самое, что долговременная память: речь идёт о том, что помещается в текущий prompt, а не о том, что модель «запомнила навсегда».

Google описывает Gemini 1.5 Pro как разреженный Transformer с Mixture-of-Experts (MoE). В техотчёте и февральском анонсе это объясняется одинаково по сути: запрос не прогоняется через все параметры сразу, а маршрутизируется к подмножеству «экспертов». Такая условная вычислительная схема позволяет растить суммарную ёмкость модели, не активируя весь объём параметров на каждом токене. Для long-context это важно не только теоретически: если цена каждого шага вывода слишком высока, огромные окна остаются красивой демонстрацией, но не рабочим продуктом.

Аналогия, только как аналогия: MoE здесь работает не как одна сверхтяжёлая команда, которую вы вызываете на каждую мелочь, а как диспетчер, который подключает только нужных специалистов. Это не означает, что длинный контекст «дешёвый», но объясняет, почему Google делала ставку именно на эффективность serving и inference, а не только на очередное увеличение числа параметров.

Второй слой метода — нативная мультимодальность. В официальных материалах Google подчёркивала, что 1.5 Pro и затем 1.5 Flash принимают вперемешку текст, изображения, аудио, видео и код. Это существенно отличает разговор о «1 млн токенов» от старого длинного контекста только для текста: теперь одно и то же окно может быть заполнено не книгой, а, например, набором документов, фрагментами интерфейсов, стенограммой встречи и роликом.

Третий практический элемент — context caching. Уже в майских developer-обновлениях Google анонсировала эту функцию как способ не отправлять один и тот же большой префикс prompt’а заново, а 27 июня 2024 года выпустила её для Gemini API. Сам факт появления caching хорошо показывает реальную инженерную проблему: чем больше окно, тем сильнее растут не только возможности, но и стоимость повторяющихся запросов.

Результаты: что именно показала Google

Если свести материалы 2024 года в одну картину, то получается не «магическая модель на 10 млн токенов», а лестница из нескольких уровней зрелости.

Уровень Что подтверждают источники Практический смысл
128k Стартовая конфигурация Gemini 1.5 Pro в феврале 2024 года. Это подтверждают февральский анонс Google и developer-пост для AI Studio. Базовый продуктовый режим на момент запуска.
1 млн Февральские материалы описывали 1 млн как экспериментальное длинное окно; к 14 мая 2024 года Google перевела 1 млн в public preview для 1.5 Pro и 1.5 Flash. Первый по-настоящему рабочий long-context-режим для разработчиков и ранних продуктовых сценариев.
2 млн Майский апдейт объявил private preview / waitlist, а пост от 27 июня 2024 года открыл 2 млн токенов для всех разработчиков. Порог, после которого становятся реалистичнее сценарии с очень большими кодовыми базами и крупными наборами документов.
До 10 млн Февральский анонс и техотчёт Gemini 1.5 отдельно говорят о тестах «up to 10 million tokens»; в аннотации arXiv и PDF-версии техотчёта авторы сообщают о near-perfect retrieval выше 99% как минимум до 10 млн токенов. Это исследовательский стресс-тест и показатель направления, а не продуктовый лимит, с которым большинство разработчиков работало в 2024 году.

Что именно измеряли? В техотчёте Google использовала не один тест, а набор диагностических и более «реалистичных» сценариев. Для текстового needle-in-a-haystack авторы и в аннотации arXiv, и в PDF-отчёте заявляют near-perfect retrieval выше 99% как минимум до 10 млн токенов. Это сильный результат именно на задаче нахождения нужного фрагмента в огромном контексте.

Но Google не ограничилась одним retrieval-тестом. По техотчёту, модель проверяли и на более прикладных сценариях: long-document QA по полной книге Les Misérables на 1462 страницы и 710K токенов, video-haystack до 10,5 часа видео и audio-haystack до 107 часов аудио. Эти числа мы сознательно привязываем к одному источнику — техническому отчёту, потому что именно там раскрыта методика.

Отдельно полезно заметить нюанс с формулировками. Когда Google в феврале писала, что модель может работать с 1 часом видео, 11 часами аудио, большим кодовым репозиторием и более чем 700 тысячами слов, это был язык раннего продуктового объяснения возможностей. Техотчёт затем расширил эти демонстрации в более строгие длинные evals. То есть «час видео» и «10,5 часа видео» не противоречат друг другу: первое — продуктовая иллюстрация раннего этапа, второе — более жёсткий исследовательский тест из отчёта.

Интерпретация

Наш комментарий

Главная новизна Gemini 1.5 была не в том, что Google просто написала на слайде очень большое число. Важнее другое: компания попыталась превратить длинный контекст в системную возможность, а не в редкую лабораторную демонстрацию. Это видно по связке из трёх решений: MoE для эффективности, мультимодальность в одном окне и context caching для повторного использования тяжёлых prompt’ов.

Для практики это меняет архитектурные компромиссы. Раньше многие пайплайны почти автоматически раскладывались на ingestion, chunking, retrieval и только потом генерацию. С Gemini 1.5 часть таких задач стало разумно пробовать иначе: не всегда дробить корпус на множество мелких кусков, а иногда давать модели более крупный, уже собранный контекст целиком — особенно если речь о bounded corpus, например о внутреннем кодовом проекте, контрактном пакете, расследовании инцидента или наборе стенограмм.

Но длинный контекст не отменяет retrieval. Скорее он сдвигает границу: некоторые задачи можно решить без внешнего поиска, а в некоторых случаях лучшим остаётся гибрид, где retrieval уменьшает шум, а длинное окно позволяет сохранить широкую картину и связность рассуждения.

Ограничения и критика

Первая и самая важная оговорка: принять 10 млн токенов — не то же самое, что надёжно рассуждать по 10 млн токенов. Сам техотчёт Google честно пишет, что long-context evals остаются открытой проблемой, и рекомендует двигаться от простых «single needle» сценариев к более насыщенным и сложным оценкам, включая multiple needles-in-a-haystack.

Вторая оговорка подтверждается независимой академической литературой. Работа Lost in the Middle: How Language Models Use Long Contexts показывает, что качество ответа может заметно зависеть от того, где именно в длинном вводе лежит релевантная информация: в начале, в конце или посередине. Авторы наблюдают U-образный профиль, где середина часто оказывается самой слабой зоной. Это не опровержение Gemini 1.5, а важное напоминание: длинное окно само по себе не убирает позиционные перекосы.

Третья оговорка — про eval-метрики. Работа RULER: What’s the Real Context Size of Your Long-Context Language Models? показывает, что почти идеальный результат на простых retrieval-задачах ещё не гарантирует хорошее поведение на более сложных long-context-сценариях, где нужно не только вытащить «иголку», но и агрегировать, проследить связи, удержать сущности и не сорваться в галлюцинации. Иными словами, между «найти фразу» и «надёжно решить задачу на длинном корпусе» остаётся разрыв.

Четвёртая оговорка — цена и задержка. Чем больше окно, тем выше стоимость входа и тем чувствительнее UX к latency. То, что Google уже летом 2024 года вывела context caching в отдельную продуктовую функцию, само по себе хороший индикатор: экономическая сторона long-context — не второстепенная, а центральная.

Пятая оговорка — безопасность. В Gemini 1.5 report Google отдельно добавила security и privacy evaluations, включая prompt injection. Для практиков это особенно важно на длинном контексте: чем больше писем, документов, кода и внешних артефактов вы загружаете в prompt, тем больше поверхность для скрытых инструкций внутри самих данных.

Вывод

Если читать первоисточники аккуратно, Gemini 1.5 в 2024 году — это не просто история про «10 миллионов токенов». Это история про то, как Google развела три уровня: 1 млн как ранний продуктовый long-context-режим, 2 млн как расширенный developer-режим и 10 млн как исследовательскую границу.

Для инженерной практики полезнее всего запомнить именно это различие. Большое окно контекста — сильный инструмент, но работает он лучше не как замена архитектуре, а как часть архитектуры: вместе с caching, evals, защитой от injection и, когда нужно, retrieval-слоем.

Источники

FAQ

Было ли у Gemini 1.5 «реально» 10 млн токенов?

В материалах 2024 года — да, но только как исследовательский стресс-тест. Для продуктового доступа Google сначала говорила о 1 млн токенов, а затем открыла 2 млн для разработчиков.

Заменяет ли длинное окно контекста RAG?

Не всегда. Для некоторых bounded-corpus сценариев длинный контекст позволяет обойтись без внешнего retrieval, но на шумных, больших и постоянно меняющихся корпусах гибрид «retrieval + long context» обычно надёжнее.

Почему Google понадобился context caching?

Потому что длинный prompt дорог и тяжёл по задержке. Если один и тот же большой префикс нужен во многих запросах, кэширование снижает цену повторной отправки и делает long-context более практичным.

Что важнее: размер окна или качество evals?

Для практики — качество evals. Большое окно расширяет класс возможных задач, но не доказывает, что модель стабильно решит именно вашу задачу на вашем распределении данных.

Читайте также