Весной 2025 OpenAI и Google почти одновременно сделали заметным один и тот же сдвиг: чат-модель начала не только обсуждать изображение, но и сама выдавать его в том же контексте диалога. Исторически этот разбор ограничен именно состоянием источников на март–май 2025 года: у OpenAI это запуск GPT-4o image generation 25 марта 2025 года, у Google — эксперимент Gemini 2.0 Flash native image generation 12 марта 2025 года и отдельная preview-версия 7 мая 2025 года (Introducing 4o Image Generation; Addendum to GPT-4o System Card: Native image generation; Experiment with Gemini 2.0 Flash native image generation; Release notes | Gemini API; Create and edit images with Gemini 2.0 in preview; Gemini deprecations).
Ниже — не новостной пересказ, а объяснение, что в этих документах реально значит слово «нативная». В индустриальном жаргоне это часто называют нативной генерацией картинок в LLM, хотя точнее говорить о нативно мультимодальной language model: модель держит общий контекст для текста и изображений и возвращает картинку как часть того же разговора.
Коротко
- «Нативная» генерация — это не просто вызов отдельной diffusion-модели из чата, а общий мультимодальный контекст, где текст, изображения и правки живут в одной сессии.
- OpenAI публично описывает 4o image generation как авторегрессионную систему, встроенную в GPT-4o, и отдельно показывает связку «tokens → transformer → diffusion → pixels».
- Google описывает Gemini 2.0 Flash как модель с нативным image output, interleaved text+image ответами и многошаговым conversational editing; позднейшая документация закрепила этот интерфейс формально.
- Главный практический эффект не в «красивее», а в другом UX: меньше ручной оркестрации между captioning, prompt-rewriting, image editing и OCR-задачами.
- Но «нативная» не значит «полностью единый монолит до пикселя»: по доступным источникам у OpenAI и по академическим аналогам видно, что общий backbone может сочетаться с отдельным визуальным декодером или специализированными путями кодирования.
Контекст: что такое нативная генерация картинок в LLM
До этой волны большинство пользовательских продуктов выглядело так: текстовый помощник принимал запрос, иногда переписывал его в более удобный prompt, а дальше передавал задачу отдельной генеративной модели изображений. Такой стек работал, но граница между «пониманием запроса» и «рисованием» оставалась явной: длинный диалог, история правок, прикреплённые изображения и текст внутри картинки часто обслуживались разными компонентами.
В декабре 2024 года Google объявила, что Gemini 2.0 поддерживает native image output и что эта возможность доступна early-access партнёрам; мартовский пост для разработчиков позже прямо сослался на этот декабрьский старт (Introducing Gemini 2.0: our new AI model for the agentic era; Experiment with Gemini 2.0 Flash native image generation). 12 марта 2025 года Google открыла экспериментальную версию Gemini 2.0 Flash с image generation и editing для разработчиков, а 7 мая 2025 года выделила preview-модель gemini-2.0-flash-preview-image-generation (Google Developers Blog, 12 марта; Gemini API changelog; Google Developers Blog, 7 мая; Gemini deprecations).
У OpenAI аналогичный сдвиг стал публичным 25 марта 2025 года: image generation была встроена в GPT-4o как штатная часть ChatGPT, а позже тот же класс возможностей был вынесен в API через gpt-image-1 как «natively multimodal language model» (Introducing 4o Image Generation; Addendum to GPT-4o System Card: Native image generation; GPT Image 1 Model; Introducing our latest image generation model in the API).
Важно: сама идея не возникла из ниоткуда. Её исследовательские предшественники хорошо видны в работах Chameleon, Show-o и Janus, где один общий мультимодальный стек пытаются научить и понимать, и генерировать изображения.
Метод: как это работает в GPT-4o и Gemini
Если упростить до инженерной схемы, нативная генерация означает следующее: текст и изображения сначала переводятся в совместимые внутренние представления, дальше модель строит единый контекст поверх них, а затем может вернуть либо текст, либо изображение, либо их смесь. Для пользователя это выглядит как один разговор; для системы это обычно означает более тесную интеграцию понимания и генерации, чем в связке «чат отдельно, image model отдельно».
текст + изображения → токены / сжатые визуальные представления → общий мультимодальный backbone → визуальное представление → декодер → пиксели
Что подтверждено для GPT-4o
OpenAI пишет, что 4o image generation «embedded natively» в GPT-4o и прямо противопоставляет её DALL·E как отдельной diffusion-модели: в системной карте сказано, что 4o image generation — авторегрессионная модель, нативно встроенная в ChatGPT (Addendum to GPT-4o System Card: Native image generation; Introducing 4o Image Generation).
При этом OpenAI раскрывает не полную архитектуру, а только ориентиры. В анонсе есть whiteboard-схема с формулировкой про «one big autoregressive transformer», «compressed representations» и цепочку «tokens → transformer → diffusion → pixels». Это важная оговорка: публичные материалы не подтверждают тезис «всё делается одним и тем же блоком до последнего пикселя». Скорее, они показывают общий мультимодальный авторегрессионный prior, поверх которого работает мощный декодер (Introducing 4o Image Generation; для сопоставимого паттерна в открытой литературе см. Show-o).
Ещё один практический признак нативности у OpenAI — использование знаний о мире и контекста чата при генерации и трансформации изображения. Это не отдельный «prompt box для картинок», а продолжение того же диалога, где уже были документы, загруженные референсы и текстовые ограничения (Introducing 4o Image Generation; GPT Image 1 Model).
Что подтверждено для Gemini
У Google публичное описание ещё более продуктово-ориентировано. В мартовском анонсе разработчикам показаны четыре ключевых сценария: совместный вывод текста и картинок, conversational image editing на нескольких ходах, использование знаний о мире и improved text rendering (Experiment with Gemini 2.0 Flash native image generation; Introducing Gemini 2.0: our new AI model for the agentic era).
Модельная карта Gemini 2.0 Flash добавляет архитектурную рамку: серия Gemini 2.0 строится поверх sparse Mixture-of-Experts Transformer, а image outputs на дату публикации карты оставались experimental (Gemini 2.0 Flash Model Card; Experiment with Gemini 2.0 Flash native image generation). Позднейшая документация Gemini API полезна здесь не как новое утверждение о качестве, а как более формальное описание интерфейса: модель может возвращать текст и картинку вместе, поддерживает multi-turn image editing как рекомендуемый режим и позволяет явно задавать response_format для текста, изображения или их комбинации (Image generation | Gemini API; Create and edit images with Gemini 2.0 in preview).
Технический вывод из источников
На наш взгляд, по совокупности официальных документов и открытых исследовательских аналогов разумно понимать «нативную» генерацию не как магический отказ от всех специализированных компонентов, а как перенос главной логики управления контекстом в общий мультимодальный backbone. Именно так это описывается в академических работах: Chameleon строит early-fusion mixed-modal модель; Show-o объединяет авторегрессионное и дискретное diffusion-моделирование; Janus специально разводит visual encoding для понимания и генерации, чтобы снять конфликт между этими задачами.
Результаты: что реально стало возможным в 2025 году
Если смотреть не на маркетинговые формулировки, а на подтверждённые продуктовые свойства, весна 2025 принесла прежде всего новую форму взаимодействия с моделью. Ниже — то, что источники документируют достаточно прямо.
| Аспект | GPT-4o | Gemini 2.0 Flash |
|---|---|---|
| Что источники называют нативным | Генерация изображений встроена в GPT-4o и работает внутри того же чата. | Модель может понимать текст и изображения и возвращать изображения как часть того же взаимодействия. |
| Работа с изображениями на входе | Поддерживаются image-to-image трансформации и использование загруженных изображений как контекста. | Поддерживаются редактирование, рестайлинг и продолжение работы с уже загруженной картинкой. |
| Многоходовый цикл правок | Да, через обычный чат-контекст. | Да, conversational editing заявлен как штатный сценарий. |
| Что особенно подчеркивают источники | Следование детальным инструкциям, рендеринг текста, использование знаний модели и контекста диалога. | Совместный вывод текста и изображений, целостность персонажей и сцен, world understanding, rendering текста. |
| Происхождение контента | C2PA metadata и внутренние инструменты проверки происхождения. | SynthID watermark для сгенерированных изображений. |
| Исторический канал доступа в 2025 году | Сначала ChatGPT и Sora, затем API через gpt-image-1. |
Сначала experimental, затем preview-модель в AI Studio, Gemini API и Vertex AI. |
Практически это означает, что задача «сделай схему, затем перестрой её под другой формат, сохрани подписи и не меняй логотип» перестаёт быть каскадом из нескольких хрупких вызовов. Во многих случаях её можно вести как один разговор с общей историей.
Наш комментарий
Для практиков это важнее, чем очередная гонка за эстетическим качеством. Нативная генерация меняет не только модель, но и способ проектирования продукта.
Во-первых, меняется единица интерфейса. Раньше вы проектировали отдельные формы: prompt для генерации, отдельный экран редактирования, отдельный OCR/QA-проход. Теперь базовой единицей становится мультимодальная сессия, в которой пользователь уточняет задачу по ходу работы.
Во-вторых, меняется оркестрация. Там, где раньше приходилось вручную связывать LLM, rewriter, image model, editor и иногда ещё verifier, часть этой связности уходит внутрь одной модели или одного tightly coupled стека. Это не убирает пайплайны совсем, но сокращает число переходов состояния между компонентами.
В-третьих, меняется то, что надо оценивать. Если модель генерирует картинку как часть разговора, то важны не только визуальная «красота» и следование одному prompt, но и сохранение состояния между ходами, локальность правок, стабильность текста внутри изображения, управление ссылочными объектами и корректная provenance-разметка.
Ограничения и критика
1. Публичная прозрачность ограничена. Ни OpenAI, ни Google не дали полного технического описания уровня полноценного research paper именно для этих продуктовых релизов. Поэтому часть архитектурной картины приходится восстанавливать по косвенным признакам и сопоставлять с открытыми работами вроде Chameleon, Show-o и Janus.
2. «Нативная» не равна «один монолит без декодера». Для GPT-4o это особенно важно: сама OpenAI в whiteboard-схеме показывает отдельный decoder/diffusion-этап. То есть нативность здесь прежде всего про общий мультимодальный контекст и приор, а не обязательно про полное устранение специализированных визуальных компонентов.
3. Знания о мире не гарантируют фактическую точность. Google прямо оговаривает, что world knowledge модели широкое, но не полное и не абсолютное. Это значит, что «сделай реалистичную инфографику по теме X» всё ещё требует проверки фактов и подписи, особенно если картинка несёт информационную нагрузку (Experiment with Gemini 2.0 Flash native image generation; Image generation | Gemini API).
4. Права и политика использования никуда не исчезают. В документации Google отдельно сказано, что загружать можно только изображения, на которые у вас есть права. OpenAI отдельно описывает ограничения вокруг living artists и чувствительных сценариев с реальными людьми. То есть нативный интерфейс не отменяет старых юридических и policy-рисков (Image generation | Gemini API; Addendum to GPT-4o System Card: Native image generation).
5. Весной 2025 это был ещё не финальный режим зрелости. У Gemini image outputs долго оставались experimental/preview на уровне названий моделей и модельной карты. У OpenAI возможностей было больше в продукте, чем в публичном техническом описании. Поэтому сравнивать эти системы как окончательно устоявшиеся архитектуры было бы преждевременно (Gemini 2.0 Flash Model Card; Gemini deprecations; GPT Image 1 Model).
Вывод
Если коротко, нативная генерация картинок в LLM — это переход от «чат над отдельной image model» к общему мультимодальному контексту, где модель может понимать, обсуждать, редактировать и генерировать изображение в рамках одной сессии. Весной 2025 именно этот переход публично обозначили GPT-4o и Gemini 2.0 Flash.
Для разработчика главный вопрос теперь не «рисует ли модель красивее», а «насколько хорошо она держит состояние мультимодального диалога». Отсюда и новый набор инженерных задач: оценка локальности правок, текстового рендеринга, устойчивости персонажей и объектов, provenance, а также точности визуальных артефактов, которые модель создаёт, опираясь на общий контекст.
Источники
- Introducing 4o Image Generation — официальный анонс OpenAI о встроенной генерации изображений в GPT-4o.
- Addendum to GPT-4o System Card: Native image generation — системная карта с описанием рисков и архитектурных отличий от DALL·E.
- GPT Image 1 Model — карточка API-модели, где OpenAI формально называет её natively multimodal language model.
- Introducing our latest image generation model in the API — вынос того же класса возможностей OpenAI в API.
- Introducing Gemini 2.0: our new AI model for the agentic era — декабрьское объявление Google о native image output в Gemini 2.0.
- Experiment with Gemini 2.0 Flash native image generation — мартовский пост Google для разработчиков о native image generation.
- Create and edit images with Gemini 2.0 in preview — майский переход к preview-модели для генерации и редактирования изображений.
- Release notes | Gemini API — хронология релизов и точные названия моделей.
- Gemini deprecations — подтверждение даты релиза preview-модели и её последующей замены.
- Gemini 2.0 Flash Model Card — модельная карта с описанием архитектурного семейства и статуса image outputs.
- Image generation | Gemini API — формальное описание interleaved text+image ответов, multi-turn editing и ограничений.
- Chameleon: Mixed-Modal Early-Fusion Foundation Models — исследовательский фон для early-fusion мультимодальных моделей.
- Show-o: One Single Transformer to Unify Multimodal Understanding and Generation — открытая работа о едином трансформере для понимания и генерации.
- Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation — работа о разделении visual encoding внутри единой мультимодальной модели.
FAQ
Чем нативная генерация отличается от обычного вызова image model из чата?
Главное отличие — общий контекст. Модель не просто пересылает prompt наружу, а удерживает историю диалога, загруженные изображения и ограничения как одну мультимодальную сессию.
Значит ли «нативная», что изображение рисует ровно тот же трансформер без отдельного декодера?
Нет. По открытым материалам OpenAI, по крайней мере для GPT-4o, есть общий авторегрессионный уровень и отдельный decoder/diffusion-этап. Поэтому «нативная» скорее описывает связность системы, чем обязательную архитектурную монолитность.
Почему у таких систем обычно лучше получается текст внутри картинки?
Потому что текст не живёт вне модели как внешний шумный атрибут. В общей мультимодальной сессии языковой backbone напрямую участвует в формировании визуального результата, поэтому инструкции про подписи, лейблы и layout лучше согласуются с изображением.
Можно ли уже полностью отказаться от отдельных image pipelines?
Не всегда. Для многих прикладных сценариев нативная модель упрощает UX и часть оркестрации, но специализированные пайплайны остаются полезны там, где нужны жёсткая воспроизводимость, точная постобработка, контроль авторских прав или проверяемая фактология.
