
Рестораны, кафе и бренды всё чаще обращаются к нейросетям для создания рекламных изображений еды, но результат вызывает скорее отвращение, чем аппетит. Креветки, сливающиеся с пончиками, буррито, наполненные червеобразными структурами, и мороженое, напоминающее строительный материал, — это не случайные сбои, а системные проблемы современных диффузионных моделей. Группа исследователей из Оксфордского университета, Университета Цюриха и Королевского колледжа Лондона объяснила, почему нейросети так плохо справляются с изображением еды.
Ключевые факты
| Проблема | Причина | Пример |
|---|---|---|
| Ошибки базовой структуры | Диффузионные модели восстанавливают крупные формы на ранних этапах, а детали — на поздних; если структура изначально неверна, текстуры наслаиваются на неправильную основу | Креветка-пончик, бургер из камня |
| Неспособность генерировать тонкие непрерывные объекты | Модели «слабы» в создании тонких, непрерывных, заканчивающихся структур — лапши, усиков, нитей | Лапша, прорастающая сквозь буррито, спагетти-подобные артефакты |
| Отсутствие понимания физического мира | Нейросеть воспроизводит статистические паттерны, не зная, что такое бутерброд, лапша или буррито на самом деле | Мороженое с текстурой треснувшего бетона |
| Проблемы с повторяющимися текстурами | Пузырьки, семена и отверстия «разливаются» за границы объектов | Буррито с трипофобными дырами |
Структурные ошибки: почему креветка становится пончиком
Крис Расселл, профессор ИИ, управления и политики Оксфордского университета, специалист по компьютерному зрению, объясняет корень проблемы в самом процессе генерации. Диффузионные модели начинают с изображения чистого шума и постепенно удаляют его, шаг за шагом восстанавливая картинку. «Это означает, что грубые структуры восстанавливаются в первую очередь, а мелкие текстурные детали — в последнюю», — говорит Расселл. Если на раннем этапе модель неправильно определяет базовую форму объекта, то на финальных шагах она накладывает яркие текстуры на уже искажённую основу.
«Это тот же тип сбоя, который мы видим, когда модель генерирует человека с шестью пальцами вместо пяти», — добавляет Расселл. Именно так, по его мнению, возникают креветки, неотличимые от пончиков, или бургеры, больше похожие на геологическую породу.
Лапша, дыры и трипофобия: текстуры, которые выходят из-под контроля
Джованбаттиста Калифано, поведенческий scientist из Университета Неаполя имени Федерико II, изучающий реакции на ИИ-изображения, указывает на ещё одну техническую уязвимость диффузионных моделей. «Диффузионные модели notoriously слабы в генерации тонких, непрерывных, заканчивающихся структур, — утверждает Калифано. — Лапша, усики, нити — это именно та геометрия, которая вызывает сбои. В результате спагетти-подобные артефакты проникают в места, где им не место ни анатомически, ни кулинарно».
Модель, начав генерировать такой объект, с трудом определяет, где он должен закончиться и к чему крепиться. Аналогичная проблема возникает с повторяющимися текстурами — пузырьками, семенами, отверстиями. Они «разливаются» за разумные границы, создавая изображения, способные вызвать трипофобию — страх перед скоплениями отверстий.
Еда без понимания: почему нейросеть не знает, что такое бутерброд
Роланд Мейер, профессор цифровых культур и искусств Цюрихского университета, формулирует фундаментальную проблему: «ИИ-генерация изображений воспроизводит внешний вид без proper knowledge о мире». У модели нет понимания того, что такое бутерброд, лапша или буррито. Она знает, как эти вещи выглядят на статистическом уровне, но не знает, почему они выглядят именно так и как должны себя вести в реальности.
Это отсутствие понимания приводит к тому, что модель комбинирует текстуры, которые выглядят нормально в одном контексте, но становятся отвратительными в другом. Майкл Кук, старший преподаватель компьютерных наук Королевского колледжа Лондона, объясняет: «Эти текстуры могут выглядеть совершенно нормально в архитектурном контексте. Но они становятся неправильными, когда мы представляем их как еду». Именно поэтому мороженое приобретает текстуру треснувшего бетона, а бургер — камня.
Проблема обучающих данных: кто будет постить обычное яблоко?
К проблемам архитектуры моделей добавляется искажение в обучающих данных. Саймон Колтон, профессор вычислительного творчества, игр и искусственного интеллекта Лондонского университета королевы Марии, отмечает, что в интернете может быть относительно мало изображений обычных красных яблок. «Кто захочет постить изображение скучного яблока в интернете?» — задаётся вопросом Колтон. Странные, необычные, стилизованные изображения, напротив, находят большую аудиторию на платформах вроде Reddit.
Фуд-фотография к тому же часто highly stylized: резкие контрасты, интенсивные цвета, глянцевый свет, преувеличенные формы. Иногда «еда», которую фотографируют, вообще не является едой. Мейер подчёркивает: нейросети отлично усваивают эти поверхностные качества и визуальные конвенции, но воспроизводят их без понимания контекста. «Другими словами, ИИ-генерация изображений perfectly имитирует внешний вид фотографии, но не её профессиональные эстетические стратегии. Именно это делает их такими unsettling».
Что это значит для бизнеса и потребителей
Для ресторанов и брендов, использующих ИИ-генерацию для рекламы, эти технические ограничения создают реальные репутационные риски. Изображения, которые выглядят несъедобно или откровенно отталкивающе, могут нанести вред восприятию бренда. С другой стороны, понимание причин этих сбоев может помочь разработчикам инструментов генерации — будь то корректировка архитектуры моделей, улучшение обучающих данных или внедрение специализированных фильтров для проверки результатов.
Для потребителей и читателей, следящих за развитием ИИ, ситуация показательна: она демонстрирует фундаментальное различие между статистическим воспроизведением паттернов и реальным пониманием мира. Те же самые механизмы, которые создают «лапшу из буррито», могут порождать и другие типичные ошибки генерации — от лишних пальцев до искажённых перспектив. Это не баги, которые можно исправить одним обновлением, а ограничения, заложенные в саму архитектуру диффузионных моделей.
