COMRAD404 / GLOSSARY

Text-to-Image (T2I): генерация изображений по тексту

Text-to-Image (T2I)

Text-to-Image (T2I) — генерация нового изображения по текстовому промпту. Разбираем, как это работает, чем отличается от I2I и какие API официально актуальны на 2026-08-16.

TL;DR

Text-to-Image (T2I) — это генерация нового изображения по текстовому промпту.

Text-to-Image (T2I) — это задача генерации нового изображения по текстовому описанию. В формулировке OpenAI для DALL·E 3 такой системе на вход подаётся текстовый промпт, а на выходе получается новое изображение. По состоянию на 2026-08-16 в официальных API актуальные линии для этой задачи — OpenAI GPT Image 2, Google Gemini 3.1 Flash Image и Stability AI Stable Image / SD3.5, но доступность, тарифы и лицензии нужно перепроверять у вендора.

Английский термин: text-to-image. Также встречается: T2I, «генерация изображений по тексту», реже — «prompt-to-image». Не путайте T2I с Image-to-Image (I2I), где у вас уже есть исходная картинка для преобразования.

Платформа Что сейчас задокументировано как актуальное Что важно проверить
OpenAI GPT Image 2; доступны v1/images/generations и v1/images/edits Free tier не поддерживается; для части разработчиков могут действовать требования верификации организации; старые image-модели в каталоге помечены как deprecated
Google Gemini 3.1 Flash Image как основной image-модельный путь API доступен только в перечисленных регионах; сгенерированные изображения включают SynthID watermark; Imagen 4 модели задепрекейчены и запланированы к отключению 2026-08-17
Stability AI Линия Stable Image / SD3.5; текущий путь — REST v2beta Старые gRPC и REST v1 в legacy maintenance; условия коммерческого использования отличаются от research/community terms

Редакционное ограничение: официальные страницы вендоров быстро меняются. В этой статье сознательно не фиксируются детальные сравнения качества, квот и цен вне того, что прямо отражено в источниках на дату 2026-08-16.

Простыми словами

Грубо говоря, T2I — это «нарисуй мне картинку по описанию». Вы не загружаете фотографию и не ретушируете готовый файл, а словами задаёте сцену: что изображено, в каком стиле, с каким светом, ракурсом и ограничениями.

Можно представить это как бриф для иллюстратора: чем точнее вы описали объект, композицию и стиль, тем ближе результат к ожиданию. Но, в отличие от человека, модель не «понимает» сцену как художник; она статистически строит новое изображение по закономерностям, выученным на данных.

Как это работает

У разных платформ внутренняя архитектура может отличаться, а закрытые API не всегда раскрывают её полностью. Но во многих современных T2I-системах логика похожа на diffusion или latent diffusion: текст превращается в условие для генерации, модель начинает не с готовой картинки, а с шума или латентного представления, затем по шагам формирует изображение, согласованное с описанием. Такой фон хорошо описан в работах по Imagen, latent diffusion и DALL·E 3.

  1. Промпт. Вы задаёте текст: объект, стиль, композицию, ограничения.
  2. Текстовое представление. Система кодирует описание в форму, удобную для генератора.
  3. Начальное состояние. Генерация часто стартует с шума или латентного пространства, а не с «пустого холста» в человеческом смысле.
  4. Пошаговое уточнение. Модель многошагово приближает изображение к условиям промпта.
  5. Декодирование и возврат результата. Пользователь получает новое изображение; в некоторых API доступны и отдельные режимы редактирования.
Текстовый промпт
      ↓
Текстовое кодирование
      ↓
Шум / латентное представление
      ↓
Итерации генерации под условием текста
      ↓
Декодирование в изображение
      ↓
Итоговый файл

Важно: это обобщённая схема, а не раскрытие конкретной внутренней реализации каждого коммерческого API. Например, в документации Google Gemini 3.1 Flash Image акцент сделан на входах и выходах модели: она принимает текст, изображения и PDF, а возвращать может изображение или текст. Для T2I вас интересует частный случай, где вход — текст, а выход — новое изображение.

Где применяется

На практике T2I встречается не как абстрактная «картинка из слов», а как конкретный режим API и производственный шаг.

  • Новая генерация по промпту. В OpenAI это соответствует image-generation API с путём v1/images/generations для создания нового изображения по тексту.
  • Генерация плюс правки. Если после первой попытки нужно исправить объект, фон или композицию, у OpenAI для этого есть v1/images/edits, а у Gemini 3.1 Flash Image документирована разговорная мультимодальная работа с текстом и изображениями.
  • Мультимодальные пайплайны. В Gemini 3.1 Flash Image входом может быть не только текст, но и изображение или PDF. Это полезно, когда промпт строится на основе брифа, документа или референса.
  • Интеграция в backend и batch-сценарии. У Stability AI текущей продуктовой линией названа Stable Image, а актуальный интерфейс — REST v2beta. Для команд это важно, потому что старые gRPC и REST v1 уже находятся в legacy maintenance.

Если ваша задача переходит от одиночной картинки к ролику, это уже соседний класс задач — Text-to-video. А если нужно изменить существующее изображение, а не синтезировать сцену с нуля, чаще полезнее смотреть в сторону I2I.

Практический пример

Сценарий: вам нужна обложка для статьи или лендинга без логотипов и текста внутри изображения. Вместо длинного общего описания лучше собрать промпт из управляемых блоков.

Minimal editorial illustration of a silver laptop on a dark desk,
soft side lighting, clean composition, realistic materials,
16:9, no text, no logo, no watermark, single main subject

Как читать такой промпт:

  • Что изображено: silver laptop on a dark desk.
  • Стиль и материал: minimal editorial illustration, realistic materials.
  • Свет и композиция: soft side lighting, clean composition.
  • Ограничения: 16:9, no text, no logo, single main subject.

Дальше вы меняете по одной переменной за раз: сначала ракурс, потом стиль, потом свет. Если нужна точечная коррекция уже сгенерированной картинки, это обычно не «ещё один T2I-промпт», а режим редактирования или переход к image-to-image.

Практический вывод: хороший T2I-промпт — это не «красивый длинный текст», а короткое описание сцены плюс жёсткие ограничения. Предсказуемость между вендорами всё равно будет отличаться.

Чем отличается от…

Термин Вход Выход Когда нужен
Text-to-Image (T2I) Текстовый промпт Новое изображение Когда сцену нужно синтезировать с нуля
Image-to-Image (I2I) Исходное изображение, часто плюс текст Изменённое изображение Когда у вас уже есть основа и её нужно преобразовать
Text-to-video Текстовый промпт Последовательность кадров / видео Когда нужна динамика, а не один кадр
Text-to-Speech (TTS) Текст Аудио / речь Когда выходом должен быть голос, а не изображение

Самая частая путаница — между T2I и I2I. Проверочный вопрос простой: у вас уже есть картинка, которую надо переделать? Если да, это обычно не чистый T2I.

Ограничения и заблуждения

  • Заблуждение: «T2I — это один конкретный инструмент». На самом деле это класс задач. Его реализуют разные модельные линии и API.
  • Заблуждение: «если в старом гайде есть DALL·E 3 или Imagen 4, значит их и надо брать». По текущим каталогам OpenAI DALL·E 3 и DALL·E 2 помечены как deprecated, а Google задокументировал deprecated-статус Imagen 4 generate, ultra и fast с отключением 2026-08-17.
  • Ограничение доступа. У OpenAI GPT Image 2 Free tier не поддерживается; для части разработчиков могут действовать требования верификации. У Google доступ зависит от списка поддерживаемых стран и территорий.
  • Ограничение использования. У Google сгенерированные изображения включают SynthID watermark. У Stability AI режимы research/community и commercial/enterprise различаются по лицензии и условиям.
  • Ограничение прозрачности. Не каждый коммерческий API подробно раскрывает внутреннюю архитектуру. Поэтому нельзя автоматически переносить выводы из одной научной статьи на любой закрытый сервис.
  • Ограничение совместимости. У Stability AI текущим считается REST v2beta, а старые интерфейсы поддерживаются в legacy-режиме. Для production это важнее, чем популярность старого туториала.

Практический вердикт: выбирайте не «лучший T2I вообще», а текущий официальный API под ваш сценарий: генерация с нуля, редактирование, региональная доступность, watermark, лицензия и жизненный цикл модели. Если страница вендора давно не обновлялась или ссылается на deprecated-модель, считайте инструкцию устаревшей.

Связанные термины, инструменты и исследования

  • Image-to-Image (I2I) — когда нужно менять уже существующее изображение.
  • Text-to-video — соседняя задача генерации, где выходом становится ролик.
  • Text-to-Speech (TTS) — полезно для понимания семейства задач «text-to-X».
  • Runway ML (Gen-3, image tools) — image-аппы сейчас — практический инструментальный контекст рядом с генерацией изображений.
  • Для теоретической базы смотрите работы по DALL·E 3, Imagen и latent diffusion в списке источников ниже.

Источники

Вопросы и ответы

Что такое Text-to-Image простыми словами?

Это генерация новой картинки по текстовому описанию. Вы словами задаёте сцену, а модель возвращает изображение.

T2I и I2I — это одно и то же?

Нет. В T2I вы обычно начинаете с текста и синтезируете изображение с нуля. В I2I у вас уже есть исходная картинка, которую нужно изменить.

Какие T2I API официально актуальны на 2026-08-16?

По предоставленному source pack это OpenAI GPT Image 2, Google Gemini 3.1 Flash Image и Stability AI Stable Image / SD3.5. Для Google нужно отдельно помнить про региональные ограничения и отключение Imagen 4 моделей 2026-08-17.

Можно ли ориентироваться на старые гайды по DALL·E 3, Imagen 4 или SD3.0?

С осторожностью. В текущих источниках DALL·E 3 у OpenAI отмечен как deprecated, Imagen 4 у Google — deprecated с запланированным shutdown, а SD3.0 у Stability AI был переведён на SD3.5.

Что нужно проверить перед внедрением T2I в продукт?

Минимум пять вещей: текущую модель, endpoint или API-версию, условия доступа по региону или аккаунту, требования к watermark и лицензию на коммерческое использование. Эти параметры у вендоров различаются и меняются быстрее, чем базовое определение термина.

Источники

SOURCES

Вопросы и ответы

FAQ
Что такое Text-to-Image простыми словами?

Это генерация новой картинки по текстовому описанию. Вы словами задаёте сцену, а модель возвращает изображение.

T2I и I2I — это одно и то же?

Нет. В T2I вы обычно начинаете с текста и синтезируете изображение с нуля. В I2I у вас уже есть исходная картинка, которую нужно изменить.

Какие T2I API официально актуальны на 2026-08-16?

По предоставленному source pack это OpenAI GPT Image 2, Google Gemini 3.1 Flash Image и Stability AI Stable Image / SD3.5. Для Google нужно отдельно помнить про региональные ограничения и отключение Imagen 4 моделей 2026-08-17.

Можно ли ориентироваться на старые гайды по DALL·E 3, Imagen 4 или SD3.0?

С осторожностью. В текущих источниках DALL·E 3 у OpenAI отмечен как deprecated, Imagen 4 у Google — deprecated с запланированным shutdown, а SD3.0 у Stability AI был переведён на SD3.5.

Что нужно проверить перед внедрением T2I в продукт?

Минимум пять вещей: текущую модель, endpoint или API-версию, условия доступа по региону или аккаунту, требования к watermark и лицензию на коммерческое использование. Эти параметры у вендоров различаются и меняются быстрее, чем базовое определение термина.

Читайте также

LINKS