Text-to-Image (T2I) — это задача генерации нового изображения по текстовому описанию. В формулировке OpenAI для DALL·E 3 такой системе на вход подаётся текстовый промпт, а на выходе получается новое изображение. По состоянию на 2026-08-16 в официальных API актуальные линии для этой задачи — OpenAI GPT Image 2, Google Gemini 3.1 Flash Image и Stability AI Stable Image / SD3.5, но доступность, тарифы и лицензии нужно перепроверять у вендора.
Английский термин: text-to-image. Также встречается: T2I, «генерация изображений по тексту», реже — «prompt-to-image». Не путайте T2I с Image-to-Image (I2I), где у вас уже есть исходная картинка для преобразования.
| Платформа | Что сейчас задокументировано как актуальное | Что важно проверить |
|---|---|---|
| OpenAI | GPT Image 2; доступны v1/images/generations и v1/images/edits |
Free tier не поддерживается; для части разработчиков могут действовать требования верификации организации; старые image-модели в каталоге помечены как deprecated |
| Gemini 3.1 Flash Image как основной image-модельный путь | API доступен только в перечисленных регионах; сгенерированные изображения включают SynthID watermark; Imagen 4 модели задепрекейчены и запланированы к отключению 2026-08-17 | |
| Stability AI | Линия Stable Image / SD3.5; текущий путь — REST v2beta | Старые gRPC и REST v1 в legacy maintenance; условия коммерческого использования отличаются от research/community terms |
Редакционное ограничение: официальные страницы вендоров быстро меняются. В этой статье сознательно не фиксируются детальные сравнения качества, квот и цен вне того, что прямо отражено в источниках на дату 2026-08-16.
Простыми словами
Грубо говоря, T2I — это «нарисуй мне картинку по описанию». Вы не загружаете фотографию и не ретушируете готовый файл, а словами задаёте сцену: что изображено, в каком стиле, с каким светом, ракурсом и ограничениями.
Можно представить это как бриф для иллюстратора: чем точнее вы описали объект, композицию и стиль, тем ближе результат к ожиданию. Но, в отличие от человека, модель не «понимает» сцену как художник; она статистически строит новое изображение по закономерностям, выученным на данных.
Как это работает
У разных платформ внутренняя архитектура может отличаться, а закрытые API не всегда раскрывают её полностью. Но во многих современных T2I-системах логика похожа на diffusion или latent diffusion: текст превращается в условие для генерации, модель начинает не с готовой картинки, а с шума или латентного представления, затем по шагам формирует изображение, согласованное с описанием. Такой фон хорошо описан в работах по Imagen, latent diffusion и DALL·E 3.
- Промпт. Вы задаёте текст: объект, стиль, композицию, ограничения.
- Текстовое представление. Система кодирует описание в форму, удобную для генератора.
- Начальное состояние. Генерация часто стартует с шума или латентного пространства, а не с «пустого холста» в человеческом смысле.
- Пошаговое уточнение. Модель многошагово приближает изображение к условиям промпта.
- Декодирование и возврат результата. Пользователь получает новое изображение; в некоторых API доступны и отдельные режимы редактирования.
Текстовый промпт
↓
Текстовое кодирование
↓
Шум / латентное представление
↓
Итерации генерации под условием текста
↓
Декодирование в изображение
↓
Итоговый файл
Важно: это обобщённая схема, а не раскрытие конкретной внутренней реализации каждого коммерческого API. Например, в документации Google Gemini 3.1 Flash Image акцент сделан на входах и выходах модели: она принимает текст, изображения и PDF, а возвращать может изображение или текст. Для T2I вас интересует частный случай, где вход — текст, а выход — новое изображение.
Где применяется
На практике T2I встречается не как абстрактная «картинка из слов», а как конкретный режим API и производственный шаг.
- Новая генерация по промпту. В OpenAI это соответствует image-generation API с путём
v1/images/generationsдля создания нового изображения по тексту. - Генерация плюс правки. Если после первой попытки нужно исправить объект, фон или композицию, у OpenAI для этого есть
v1/images/edits, а у Gemini 3.1 Flash Image документирована разговорная мультимодальная работа с текстом и изображениями. - Мультимодальные пайплайны. В Gemini 3.1 Flash Image входом может быть не только текст, но и изображение или PDF. Это полезно, когда промпт строится на основе брифа, документа или референса.
- Интеграция в backend и batch-сценарии. У Stability AI текущей продуктовой линией названа Stable Image, а актуальный интерфейс — REST v2beta. Для команд это важно, потому что старые gRPC и REST v1 уже находятся в legacy maintenance.
Если ваша задача переходит от одиночной картинки к ролику, это уже соседний класс задач — Text-to-video. А если нужно изменить существующее изображение, а не синтезировать сцену с нуля, чаще полезнее смотреть в сторону I2I.
Практический пример
Сценарий: вам нужна обложка для статьи или лендинга без логотипов и текста внутри изображения. Вместо длинного общего описания лучше собрать промпт из управляемых блоков.
Minimal editorial illustration of a silver laptop on a dark desk, soft side lighting, clean composition, realistic materials, 16:9, no text, no logo, no watermark, single main subject
Как читать такой промпт:
- Что изображено:
silver laptop on a dark desk. - Стиль и материал:
minimal editorial illustration,realistic materials. - Свет и композиция:
soft side lighting,clean composition. - Ограничения:
16:9,no text,no logo,single main subject.
Дальше вы меняете по одной переменной за раз: сначала ракурс, потом стиль, потом свет. Если нужна точечная коррекция уже сгенерированной картинки, это обычно не «ещё один T2I-промпт», а режим редактирования или переход к image-to-image.
Практический вывод: хороший T2I-промпт — это не «красивый длинный текст», а короткое описание сцены плюс жёсткие ограничения. Предсказуемость между вендорами всё равно будет отличаться.
Чем отличается от…
| Термин | Вход | Выход | Когда нужен |
|---|---|---|---|
| Text-to-Image (T2I) | Текстовый промпт | Новое изображение | Когда сцену нужно синтезировать с нуля |
| Image-to-Image (I2I) | Исходное изображение, часто плюс текст | Изменённое изображение | Когда у вас уже есть основа и её нужно преобразовать |
| Text-to-video | Текстовый промпт | Последовательность кадров / видео | Когда нужна динамика, а не один кадр |
| Text-to-Speech (TTS) | Текст | Аудио / речь | Когда выходом должен быть голос, а не изображение |
Самая частая путаница — между T2I и I2I. Проверочный вопрос простой: у вас уже есть картинка, которую надо переделать? Если да, это обычно не чистый T2I.
Ограничения и заблуждения
- Заблуждение: «T2I — это один конкретный инструмент». На самом деле это класс задач. Его реализуют разные модельные линии и API.
- Заблуждение: «если в старом гайде есть DALL·E 3 или Imagen 4, значит их и надо брать». По текущим каталогам OpenAI DALL·E 3 и DALL·E 2 помечены как deprecated, а Google задокументировал deprecated-статус Imagen 4 generate, ultra и fast с отключением 2026-08-17.
- Ограничение доступа. У OpenAI GPT Image 2 Free tier не поддерживается; для части разработчиков могут действовать требования верификации. У Google доступ зависит от списка поддерживаемых стран и территорий.
- Ограничение использования. У Google сгенерированные изображения включают SynthID watermark. У Stability AI режимы research/community и commercial/enterprise различаются по лицензии и условиям.
- Ограничение прозрачности. Не каждый коммерческий API подробно раскрывает внутреннюю архитектуру. Поэтому нельзя автоматически переносить выводы из одной научной статьи на любой закрытый сервис.
- Ограничение совместимости. У Stability AI текущим считается REST v2beta, а старые интерфейсы поддерживаются в legacy-режиме. Для production это важнее, чем популярность старого туториала.
Практический вердикт: выбирайте не «лучший T2I вообще», а текущий официальный API под ваш сценарий: генерация с нуля, редактирование, региональная доступность, watermark, лицензия и жизненный цикл модели. Если страница вендора давно не обновлялась или ссылается на deprecated-модель, считайте инструкцию устаревшей.
Связанные термины, инструменты и исследования
- Image-to-Image (I2I) — когда нужно менять уже существующее изображение.
- Text-to-video — соседняя задача генерации, где выходом становится ролик.
- Text-to-Speech (TTS) — полезно для понимания семейства задач «text-to-X».
- Runway ML (Gen-3, image tools) — image-аппы сейчас — практический инструментальный контекст рядом с генерацией изображений.
- Для теоретической базы смотрите работы по DALL·E 3, Imagen и latent diffusion в списке источников ниже.
Источники
- DALL·E 3 system card | OpenAI
- Introducing our latest image generation model in the API | OpenAI
- GPT Image 2 Model | OpenAI API
- All models | OpenAI API
- Gemini API | Google AI for Developers
- Gemini 3.1 Flash Image | Gemini API | Google AI for Developers
- Gemini deprecations | Gemini API
- Available regions for Google AI Studio and Gemini API
- Release notes | Gemini API
- Stability AI – Developer Platform
- Stability AI – Developer Platform release notes
- Pricing | Stability AI Platform
- Stability AI License
- GitHub – CompVis/stable-diffusion
- Improving Image Generation with Better Captions
- Photorealistic Text-to-Image Diffusion Models
- High-Resolution Image Synthesis with Latent Diffusion Models
Вопросы и ответы
Что такое Text-to-Image простыми словами?
Это генерация новой картинки по текстовому описанию. Вы словами задаёте сцену, а модель возвращает изображение.
T2I и I2I — это одно и то же?
Нет. В T2I вы обычно начинаете с текста и синтезируете изображение с нуля. В I2I у вас уже есть исходная картинка, которую нужно изменить.
Какие T2I API официально актуальны на 2026-08-16?
По предоставленному source pack это OpenAI GPT Image 2, Google Gemini 3.1 Flash Image и Stability AI Stable Image / SD3.5. Для Google нужно отдельно помнить про региональные ограничения и отключение Imagen 4 моделей 2026-08-17.
Можно ли ориентироваться на старые гайды по DALL·E 3, Imagen 4 или SD3.0?
С осторожностью. В текущих источниках DALL·E 3 у OpenAI отмечен как deprecated, Imagen 4 у Google — deprecated с запланированным shutdown, а SD3.0 у Stability AI был переведён на SD3.5.
Что нужно проверить перед внедрением T2I в продукт?
Минимум пять вещей: текущую модель, endpoint или API-версию, условия доступа по региону или аккаунту, требования к watermark и лицензию на коммерческое использование. Эти параметры у вендоров различаются и меняются быстрее, чем базовое определение термина.