
Компания Google DeepMind объявила о выпуске Gemini Omni 1.1 Flash — производственного обновления своей мультимодальной модели для генерации и редактирования видео. Релиз ориентирован на разработчиков и создателей медиаконтента, которым требуются гибкие инструменты контроля над временной структурой роликов, камерой и качеством финального изображения. Обновление доступно через API в Google AI Studio и платформу Gemini Enterprise Agent Platform.
Главным техническим изменением стал переход на расширенный контекст анализа видеоряда. Если предыдущие версии модели учитывали только финальную секунду клипа, то Omni 1.1 Flash анализирует до 10 секунд предшествующего контекста. Это позволяет сохранять визуальную преемственность, геометрию объектов и освещение при последовательной генерации кадров, снижая вероятность артефактов и неожиданного изменения лиц персонажей.
Ключевые факты
Модель: Gemini Omni 1.1 Flash
Разработчик: Google DeepMind
Доступность: Google AI Studio API, Gemini Enterprise Agent Platform
Основные функции: Расширение сцен до 40 сек, ключевые кадры, 360p черновики, апскейлинг до 4K
Новые инструменты управления движением камеры и кадрами
В новой версии реализована функция расширения сцен (Scene extension), позволяющая продолжать генерацию видео с того момента, где закончился предыдущий фрагмент. Пользователи могут наращивать длительность роликов 10-секундными шагами, доводя общую непрерывную длительность сцены до 40 секунд без потери сюжетной логики.
Разработчики получили возможность указывать начальные и конечные кадры (first and last frame interpolation) для создания плавных переходов, панорамирования камеры и зацикленных видео. Модель также поддерживает загрузку до 3 секунд реального эталонного видео для фиксации анатомии лиц, текстуры одежды и цветовой палитры в новых генерациях.
Двухэтапный рабочий процесс для оптимизации затрат
Для снижения вычислительных затрат архитектура модели поддерживает двухэтапный пайплайн создания контента. На этапе прототипирования разработчики могут генерировать быстрые черновики в разрешении 360p, которые создаются примерно за три секунды.
Такой подход позволяет протестировать движение камеры, композицию и освещение при минимальных затратах ресурсов. После утверждения чернового варианта система выполняет бесшовный апскейлинг до 1080p или полноформатного разрешения 4K, пригодного для профессионального вещания и монтажа.
Безопасность и цифровая маркировка контента
Во все видеоматериалы, созданные с помощью Gemini Omni 1.1 Flash, встроена технология цифрового водяного знака Google SynthID. Метка внедряется непосредственно в пиксельную матрицу изображения и остается неразличимой для человеческого глаза, но позволяет автоматически подтверждать подлинность контента и его происхождение.
Внедрение таких механизмов маркировки критически важно для платформ, борющихся с дипфейками и немаркированным синтетическим контентом. Разработчики ПО для монтажа и создатели генеративных инструментов могут использовать SynthID для соблюдения стандартов прозрачности мультимодальных медиаданных.
Влияние на экосистему разработчиков
Появление Gemini Omni 1.1 Flash меняет подходы к созданию инструментов предвизуализации и генеративного видео. Разработчики программного обеспечения для видеопроизводства получают готовый интерфейс интеграции с возможностью точного контроля над динамикой сцен, что ранее требовало громоздких связок из нескольких специализированных нейросетей.
Главным ограничением для инженеров остается зависимость от облачной инфраструктуры Google AI Studio и закрытый характер весов самой модели. Тем не менее, стандартизация API и появление функций управления ключевыми кадрами ускоряют разработку специализированных редакторов и креативных агентов.
Источник: Блог Google DeepMind, https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/
Datos clave
| Punto | Detalle |
|---|---|
| Fuente | Product Hunt AI |
| Fecha | 2026-08-27T20:52:18+00:00 |
| Tema | Gemini Omni 1.1 Flash |