Image-to-Image (I2I) — это генерация или редактирование изображения, где исходная картинка служит условием для результата. В обзорной литературе I2I описывают как перенос изображения из исходного домена в целевой с сохранением содержания, а в современных diffusion-подходах — как управляемое преобразование через добавление шума и последующий денойзинг.
Если коротко: вы не генерируете картинку «с нуля», а просите модель изменить уже существующее изображение. По состоянию на 2026-08-14 в официальных API-источниках для этого среза актуальны GPT Image 2 у OpenAI и отдельный endpoint image-to-image у Stability AI; каталог OpenAI при этом помечает GPT Image 1.5, chatgpt-image-latest, GPT Image 1, gpt-image-1-mini, DALL·E 3 и DALL·E 2 как deprecated.
Английский термин: image-to-image, также встречаются I2I, image-to-image translation, image-conditioned generation/editing. В исследовательских работах акцент часто на переносе между доменами, а в продуктовой документации — на редактировании изображения по входной картинке и, нередко, текстовой инструкции.
Простыми словами
Грубо говоря, I2I можно представить как работу с редактором, которому вы отдаёте исходник и говорите: «Сохрани сцену, но измени стиль, освещение или характер изображения». Важная разница с обычной генерацией по тексту в том, что у модели уже есть опора: композиция, крупные объекты, силуэты или общая структура берутся из входной картинки.
Поэтому I2I полезен, когда вам важна управляемость. Не «нарисуй что угодно про кухню», а «вот эта кухня — сделай её как архитектурную иллюстрацию, не ломая ракурс и расположение мебели».
Как это работает
Базовая схема
Исходное изображение
↓
Извлечение структуры / содержания / визуальных опор
+
Текстовый prompt или инструкция (если сценарий это поддерживает)
↓
Генеративное преобразование
- перенос между доменами, или
- add noise → denoise в diffusion-схеме
↓
Результат: новое изображение, согласованное с входом
В классическом описании I2I задача состоит в том, чтобы перевести изображение из одного домена в другой, сохранив содержание. Обзор по теме отдельно отмечает и мультимодальные варианты: одна и та же входная картинка может иметь несколько правдоподобных результатов, если все они согласованы с исходником.
В diffusion-редактировании, на которое опирается SDEdit, логика такая: к изображению добавляют шум, а затем модель выполняет денойзинг, используя генеративный prior. Ключевая идея SDEdit — баланс между верностью входу и реалистичностью результата: чем сильнее вмешательство, тем больше шансов получить «красивый» новый образ, но тем меньше точное совпадение с исходной картинкой.
InstructPix2Pix показывает ещё один важный вариант: редактирование по пользовательской текстовой инструкции. То есть на вход подаются и изображение, и команда вроде «сделай сцену ночной» или «замени материал на дерево», а модель учится следовать такой инструкции на этапе инференса и обобщаться на реальные изображения.
В актуальной документации OpenAI это оформлено как native image generation с входными изображениями: модель может принимать несколько изображений на вход и создавать связанную или модифицированную картинку на выходе. Для GPT Image 2 официально указаны image input и image output, а также работа через endpoints v1/images/generations и v1/images/edits.
Что именно сохраняется
I2I не обещает сохранение каждого пикселя. На практике сохраняются скорее содержание, композиционные опоры, крупные формы или семантика сцены — ровно настолько, насколько это допускает выбранный метод и сила преобразования. Это особенно важно помнить в diffusion-сценариях: «сохранить всё как было, но сделать совсем по-другому» — внутренне противоречивое требование.
Где применяется
- Перенос между визуальными доменами. Классический пример из литературы: превратить изображение из одного домена в другой, сохранив содержание сцены.
- Редактирование реальных изображений по инструкции. Подход уровня InstructPix2Pix полезен, когда вам нужно задавать изменение словами, а не только подбирать референс-стиль.
- API-интеграции с входным изображением. В OpenAI GPT Image 2 поддерживает image input и image output, а страница модели отдельно упоминает высокоточные входные изображения. Это подходит для сценариев, где нужно получить вариации или правки на базе существующего файла.
- Контролируемый пайплайн с явной проверкой статуса. У Stability AI для I2I есть отдельный endpoint
POST /v1/generation/{engine_id}/image-to-image; в официальных примерах результат проверяется черезartifactsиfinishReason, где ожидаетсяSUCCESSлибоCONTENT_FILTERED.
Если смотреть на текущий продуктовый срез, то для managed API ориентиром у OpenAI служит GPT Image 2, а у Stability AI — официальный endpoint image-to-image. Если вам нужен исследовательский или локальный маршрут, референсной точкой остаётся InstructPix2Pix и его репозиторий.
Практический пример
Сценарий: у вас есть фотография комнаты, и вы хотите получить версию в стиле технической иллюстрации, сохранив ракурс и расположение крупных объектов.
- Подготовьте исходник. Чем чище композиция и чем понятнее крупные объекты, тем проще модели удержать структуру сцены.
- Сформулируйте неизменяемые требования. Например: сохранить ракурс, мебель и расположение основных предметов.
- Добавьте инструкцию. Например:
«Преобразуйте изображение в стиль технической иллюстрации.
Сохраните ракурс, расположение мебели и крупные формы.
Не добавляйте новые предметы без необходимости.»
- Выберите маршрут. Для OpenAI используйте GPT Image 2 через
v1/images/editsили сценарий с image input/image output вv1/images/generations. Если вам нужно опереться сразу на несколько референсов, системный документ OpenAI прямо указывает, что модель может принимать несколько изображений на вход. - Если нужен отдельный I2I-endpoint и проверка статуса, у Stability AI для этого есть
POST /v1/generation/{engine_id}/image-to-image. После ответа проверьтеartifactsиfinishReason. - Оцените баланс «похоже на исходник / достаточно новое». Практическое правило из логики SDEdit: если результат слишком уходит от оригинала, ослабляйте преобразование; если он почти не меняется, наоборот, допускайте более сильное вмешательство.
Этот сценарий хорошо показывает смысл I2I: вы управляете не только стилем, но и степенью уважения к входному изображению.
Чем отличается от…
| Термин | Что это | Что на входе | Ключевое отличие |
|---|---|---|---|
| Image-to-Image (I2I) | Класс задач генерации/редактирования по исходному изображению | Изображение, иногда вместе с текстовой инструкцией | Выход должен быть согласован с входной картинкой |
| Text-to-image | Генерация изображения по текстовому описанию | Обычно текстовый prompt без опорного изображения | Фокус на создании картинки «с нуля», а не на преобразовании существующей |
| SDEdit | Конкретный diffusion-метод редактирования | Изображение плюс схема add noise → denoise | Это не общий термин, а одна из техник I2I с явным компромиссом между сохранением входа и реализмом |
| InstructPix2Pix | Instruction-guided метод редактирования | Изображение и текстовая инструкция | Это частный вид I2I, где целевое изменение задаётся естественным языком |
Ограничения и заблуждения
- Заблуждение: «I2I сохраняет картинку пиксель в пиксель». Нет. Источники говорят о сохранении содержания, а SDEdit прямо описывает компромисс между верностью входу и реалистичностью результата.
- Заблуждение: «для одного входа должен быть один правильный выход». Нет. Обзор по I2I отдельно отмечает мультимодальные варианты, где существует несколько правдоподобных результатов.
- Не всякий image editing одинаков. Часть систем ориентирована на перенос между доменами, часть — на редактирование по инструкции, часть — на продуктовые API с собственными ограничениями.
- Текущая доступность и цены нестабильны. OpenAI указывает отдельный rate для image tokens, а точные тарифы нужно проверять на официальной странице. Stability AI использует биллинг в кредитах и прямо предупреждает, что условия могут меняться.
- У провайдеров есть продуктовые ограничения. Для официального endpoint Stability AI image-to-image в документации указано, что он работает только с Version 1 engines. Для OpenAI ориентироваться стоит на GPT Image 2: older image-модели в каталоге помечены как deprecated.
- Ответ может быть не только «успех». В примерах Stability AI отдельно фигурирует
CONTENT_FILTERED, то есть часть запросов может быть отфильтрована.
Практический вердикт: если у вас уже есть визуальный исходник и нужно управляемо изменить стиль, детали или характер сцены, I2I — правильный класс задач. Если исходного изображения нет, это уже сценарий ближе к Text-to-image.
Редакционное ограничение: в этой статье сознательно не перечислены все параметры запросов и не зафиксированы точные тарифы по каждому провайдеру. По supplied источникам видно, что официальные страницы OpenAI и Stability AI обновляются, а часть условий зависит от аккаунта, плана, региона и текущей маршрутизации сервисов, поэтому перед внедрением вам нужно перепроверять документацию и pricing на дату запуска.
Связанные термины и инструменты
- Text-to-image — соседний класс задач, когда опорного изображения нет.
- Prompt tuning (мягкий промпт) — полезный соседний термин, если вы разбираете, как вообще задаётся управление генерацией.
- Text-to-video: генерация видео по тексту — смежная мультимодальная постановка, но уже для видеовыхода.
- Runway ML (Gen-3, image tools) — image-аппы сейчас — инструментальная карточка для ориентира по прикладным image-сценариям.
Источники
- Image-to-Image Translation: Methods and Applications
- SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations
- InstructPix2Pix: Learning to Follow Image Editing Instructions
- GPT Image 2 Model | OpenAI API
- All models | OpenAI API
- Addendum to GPT-4o System Card: Native image generation
- OpenAI API Pricing | OpenAI
- Stability AI – Developer Platform
- Stability AI – Developer Platform
- GitHub – timothybrooks/instruct-pix2pix
Вопросы и ответы
Image-to-Image — это просто фильтр поверх картинки?
Нет. В источниках I2I описывается как класс задач генерации и редактирования, где выход согласуется с входным изображением, а не как простой визуальный фильтр.
Нужен ли для I2I текстовый prompt?
Не всегда. Классическая постановка может быть переносом между доменами, но многие современные системы и методы, включая InstructPix2Pix и продуктовые API, используют текстовую инструкцию вместе с изображением.
Чем I2I отличается от text-to-image?
Главное отличие — наличие исходного изображения на входе. В I2I вы меняете существующую картинку, а в text-to-image фокус на генерации по описанию без опорного изображения.
Можно ли гарантированно сохранить композицию один в один?
Гарантии нет. SDEdit прямо показывает компромисс между верностью исходнику и реалистичностью нового результата: чем сильнее редактирование, тем выше шанс потерять часть точного соответствия.
Что проверить перед запуском I2I через API?
Проверьте актуальность модели или endpoint, список deprecated-решений, pricing на официальной странице и поля проверки результата. Для Stability AI в примерах это artifacts и finishReason.