COMRAD404 / GLOSSARY

Image-to-Image (I2I)

Image-to-Image

Image-to-Image (I2I) — это генерация и редактирование по исходному изображению. Ниже — простое объяснение, схема работы, отличие от text-to-image и актуальные API-практики.

TL;DR

Image-to-Image (I2I) — это генерация и редактирование изображения по входной картинке, где результат должен оставаться согласованным с исходным содержанием.

Image-to-Image (I2I) — это генерация или редактирование изображения, где исходная картинка служит условием для результата. В обзорной литературе I2I описывают как перенос изображения из исходного домена в целевой с сохранением содержания, а в современных diffusion-подходах — как управляемое преобразование через добавление шума и последующий денойзинг.

Если коротко: вы не генерируете картинку «с нуля», а просите модель изменить уже существующее изображение. По состоянию на 2026-08-14 в официальных API-источниках для этого среза актуальны GPT Image 2 у OpenAI и отдельный endpoint image-to-image у Stability AI; каталог OpenAI при этом помечает GPT Image 1.5, chatgpt-image-latest, GPT Image 1, gpt-image-1-mini, DALL·E 3 и DALL·E 2 как deprecated.

Английский термин: image-to-image, также встречаются I2I, image-to-image translation, image-conditioned generation/editing. В исследовательских работах акцент часто на переносе между доменами, а в продуктовой документации — на редактировании изображения по входной картинке и, нередко, текстовой инструкции.

Простыми словами

Грубо говоря, I2I можно представить как работу с редактором, которому вы отдаёте исходник и говорите: «Сохрани сцену, но измени стиль, освещение или характер изображения». Важная разница с обычной генерацией по тексту в том, что у модели уже есть опора: композиция, крупные объекты, силуэты или общая структура берутся из входной картинки.

Поэтому I2I полезен, когда вам важна управляемость. Не «нарисуй что угодно про кухню», а «вот эта кухня — сделай её как архитектурную иллюстрацию, не ломая ракурс и расположение мебели».

Как это работает

Базовая схема

Исходное изображение
        ↓
Извлечение структуры / содержания / визуальных опор
        +
Текстовый prompt или инструкция (если сценарий это поддерживает)
        ↓
Генеративное преобразование
- перенос между доменами, или
- add noise → denoise в diffusion-схеме
        ↓
Результат: новое изображение, согласованное с входом

В классическом описании I2I задача состоит в том, чтобы перевести изображение из одного домена в другой, сохранив содержание. Обзор по теме отдельно отмечает и мультимодальные варианты: одна и та же входная картинка может иметь несколько правдоподобных результатов, если все они согласованы с исходником.

В diffusion-редактировании, на которое опирается SDEdit, логика такая: к изображению добавляют шум, а затем модель выполняет денойзинг, используя генеративный prior. Ключевая идея SDEdit — баланс между верностью входу и реалистичностью результата: чем сильнее вмешательство, тем больше шансов получить «красивый» новый образ, но тем меньше точное совпадение с исходной картинкой.

InstructPix2Pix показывает ещё один важный вариант: редактирование по пользовательской текстовой инструкции. То есть на вход подаются и изображение, и команда вроде «сделай сцену ночной» или «замени материал на дерево», а модель учится следовать такой инструкции на этапе инференса и обобщаться на реальные изображения.

В актуальной документации OpenAI это оформлено как native image generation с входными изображениями: модель может принимать несколько изображений на вход и создавать связанную или модифицированную картинку на выходе. Для GPT Image 2 официально указаны image input и image output, а также работа через endpoints v1/images/generations и v1/images/edits.

Что именно сохраняется

I2I не обещает сохранение каждого пикселя. На практике сохраняются скорее содержание, композиционные опоры, крупные формы или семантика сцены — ровно настолько, насколько это допускает выбранный метод и сила преобразования. Это особенно важно помнить в diffusion-сценариях: «сохранить всё как было, но сделать совсем по-другому» — внутренне противоречивое требование.

Где применяется

  • Перенос между визуальными доменами. Классический пример из литературы: превратить изображение из одного домена в другой, сохранив содержание сцены.
  • Редактирование реальных изображений по инструкции. Подход уровня InstructPix2Pix полезен, когда вам нужно задавать изменение словами, а не только подбирать референс-стиль.
  • API-интеграции с входным изображением. В OpenAI GPT Image 2 поддерживает image input и image output, а страница модели отдельно упоминает высокоточные входные изображения. Это подходит для сценариев, где нужно получить вариации или правки на базе существующего файла.
  • Контролируемый пайплайн с явной проверкой статуса. У Stability AI для I2I есть отдельный endpoint POST /v1/generation/{engine_id}/image-to-image; в официальных примерах результат проверяется через artifacts и finishReason, где ожидается SUCCESS либо CONTENT_FILTERED.

Если смотреть на текущий продуктовый срез, то для managed API ориентиром у OpenAI служит GPT Image 2, а у Stability AI — официальный endpoint image-to-image. Если вам нужен исследовательский или локальный маршрут, референсной точкой остаётся InstructPix2Pix и его репозиторий.

Практический пример

Сценарий: у вас есть фотография комнаты, и вы хотите получить версию в стиле технической иллюстрации, сохранив ракурс и расположение крупных объектов.

  1. Подготовьте исходник. Чем чище композиция и чем понятнее крупные объекты, тем проще модели удержать структуру сцены.
  2. Сформулируйте неизменяемые требования. Например: сохранить ракурс, мебель и расположение основных предметов.
  3. Добавьте инструкцию. Например:
«Преобразуйте изображение в стиль технической иллюстрации.
Сохраните ракурс, расположение мебели и крупные формы.
Не добавляйте новые предметы без необходимости.»
  1. Выберите маршрут. Для OpenAI используйте GPT Image 2 через v1/images/edits или сценарий с image input/image output в v1/images/generations. Если вам нужно опереться сразу на несколько референсов, системный документ OpenAI прямо указывает, что модель может принимать несколько изображений на вход.
  2. Если нужен отдельный I2I-endpoint и проверка статуса, у Stability AI для этого есть POST /v1/generation/{engine_id}/image-to-image. После ответа проверьте artifacts и finishReason.
  3. Оцените баланс «похоже на исходник / достаточно новое». Практическое правило из логики SDEdit: если результат слишком уходит от оригинала, ослабляйте преобразование; если он почти не меняется, наоборот, допускайте более сильное вмешательство.

Этот сценарий хорошо показывает смысл I2I: вы управляете не только стилем, но и степенью уважения к входному изображению.

Чем отличается от…

Термин Что это Что на входе Ключевое отличие
Image-to-Image (I2I) Класс задач генерации/редактирования по исходному изображению Изображение, иногда вместе с текстовой инструкцией Выход должен быть согласован с входной картинкой
Text-to-image Генерация изображения по текстовому описанию Обычно текстовый prompt без опорного изображения Фокус на создании картинки «с нуля», а не на преобразовании существующей
SDEdit Конкретный diffusion-метод редактирования Изображение плюс схема add noise → denoise Это не общий термин, а одна из техник I2I с явным компромиссом между сохранением входа и реализмом
InstructPix2Pix Instruction-guided метод редактирования Изображение и текстовая инструкция Это частный вид I2I, где целевое изменение задаётся естественным языком

Ограничения и заблуждения

  • Заблуждение: «I2I сохраняет картинку пиксель в пиксель». Нет. Источники говорят о сохранении содержания, а SDEdit прямо описывает компромисс между верностью входу и реалистичностью результата.
  • Заблуждение: «для одного входа должен быть один правильный выход». Нет. Обзор по I2I отдельно отмечает мультимодальные варианты, где существует несколько правдоподобных результатов.
  • Не всякий image editing одинаков. Часть систем ориентирована на перенос между доменами, часть — на редактирование по инструкции, часть — на продуктовые API с собственными ограничениями.
  • Текущая доступность и цены нестабильны. OpenAI указывает отдельный rate для image tokens, а точные тарифы нужно проверять на официальной странице. Stability AI использует биллинг в кредитах и прямо предупреждает, что условия могут меняться.
  • У провайдеров есть продуктовые ограничения. Для официального endpoint Stability AI image-to-image в документации указано, что он работает только с Version 1 engines. Для OpenAI ориентироваться стоит на GPT Image 2: older image-модели в каталоге помечены как deprecated.
  • Ответ может быть не только «успех». В примерах Stability AI отдельно фигурирует CONTENT_FILTERED, то есть часть запросов может быть отфильтрована.

Практический вердикт: если у вас уже есть визуальный исходник и нужно управляемо изменить стиль, детали или характер сцены, I2I — правильный класс задач. Если исходного изображения нет, это уже сценарий ближе к Text-to-image.

Редакционное ограничение: в этой статье сознательно не перечислены все параметры запросов и не зафиксированы точные тарифы по каждому провайдеру. По supplied источникам видно, что официальные страницы OpenAI и Stability AI обновляются, а часть условий зависит от аккаунта, плана, региона и текущей маршрутизации сервисов, поэтому перед внедрением вам нужно перепроверять документацию и pricing на дату запуска.

Связанные термины и инструменты

Источники

  1. Image-to-Image Translation: Methods and Applications
  2. SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations
  3. InstructPix2Pix: Learning to Follow Image Editing Instructions
  4. GPT Image 2 Model | OpenAI API
  5. All models | OpenAI API
  6. Addendum to GPT-4o System Card: Native image generation
  7. OpenAI API Pricing | OpenAI
  8. Stability AI – Developer Platform
  9. Stability AI – Developer Platform
  10. GitHub – timothybrooks/instruct-pix2pix

Вопросы и ответы

Image-to-Image — это просто фильтр поверх картинки?

Нет. В источниках I2I описывается как класс задач генерации и редактирования, где выход согласуется с входным изображением, а не как простой визуальный фильтр.

Нужен ли для I2I текстовый prompt?

Не всегда. Классическая постановка может быть переносом между доменами, но многие современные системы и методы, включая InstructPix2Pix и продуктовые API, используют текстовую инструкцию вместе с изображением.

Чем I2I отличается от text-to-image?

Главное отличие — наличие исходного изображения на входе. В I2I вы меняете существующую картинку, а в text-to-image фокус на генерации по описанию без опорного изображения.

Можно ли гарантированно сохранить композицию один в один?

Гарантии нет. SDEdit прямо показывает компромисс между верностью исходнику и реалистичностью нового результата: чем сильнее редактирование, тем выше шанс потерять часть точного соответствия.

Что проверить перед запуском I2I через API?

Проверьте актуальность модели или endpoint, список deprecated-решений, pricing на официальной странице и поля проверки результата. Для Stability AI в примерах это artifacts и finishReason.

Источники

SOURCES

Вопросы и ответы

FAQ
Image-to-Image — это просто фильтр поверх картинки?

Нет. В источниках I2I описывается как класс задач генерации и редактирования, где выход согласуется с входным изображением, а не как простой визуальный фильтр.

Нужен ли для I2I текстовый prompt?

Не всегда. Классическая постановка может быть переносом между доменами, но многие современные системы и методы используют текстовую инструкцию вместе с изображением.

Чем I2I отличается от text-to-image?

Главное отличие — наличие исходного изображения на входе. В I2I вы меняете существующую картинку, а в text-to-image фокус на генерации по описанию без опорного изображения.

Можно ли гарантированно сохранить композицию один в один?

Нет. SDEdit показывает компромисс между верностью исходнику и реалистичностью нового результата: чем сильнее редактирование, тем выше шанс потерять часть точного соответствия.

Что проверить перед запуском I2I через API?

Проверьте актуальность модели или endpoint, список deprecated-решений, pricing на официальной странице и поля проверки результата. Для Stability AI в примерах это artifacts и finishReason.

Читайте также

LINKS