
Исследователи Google Research представили работу, проливающую свет на природу “креативности” диффузионных моделей — их способности создавать новые, ранее не встречавшиеся данные. Согласно публикации “On the Interpolation Effect of Score Smoothing in Diffusion Models”, представленной на конференции ICLR 2026, эта универсальная черта генеративных моделей является не случайностью, а прямым следствием математических процессов, происходящих во время обучения нейронных сетей.
Ключевая идея заключается в том, что обучение нейронных сетей естественным образом приводит к “сглаживанию” так называемой функции оценки (score function). Эта функция играет роль “силового поля”, направляющего процесс преобразования случайного шума в осмысленные данные, такие как изображения или молекулярные структуры.
Почему модели генерируют новое?
Диффузионные модели работают, начиная с полностью зашумленных данных и постепенно восстанавливая их структуру. Этот процесс обратный к намеренному внесению шума в реальные данные для обучения модели. Если бы модель идеально запоминала обучающие примеры, она бы просто воспроизводила их — это называется “меморизацией”. Однако на практике диффузионные модели демонстрируют способность к обобщению и созданию уникальных результатов.
Исследователи Google объясняют это тем, что процесс обучения нейронных сетей, особенно с учетом регуляризации (например, weight decay), не позволяет идеально выучить “чистую” функцию оценки. Вместо этого сеть формирует ее “сглаженную” версию. Эта сглаженность приводит к тому, что модель начинает интерполировать между обучающими точками данных, а не стремиться точно к ним. Вместо того чтобы “притягивать” выходные данные строго к существующим примерам, модель создает новые, правдоподобные образцы, находящиеся “между” ними.
Математическая основа сглаживания
В работе используется аналогия с одномерным миром, где есть две точки данных: +1 и -1. Идеальная функция оценки имела бы резкий перепад в точке 0, разделяя пространство на две области, каждая из которых стремится к своей точке. Это привело бы к чистому запоминанию. Однако нейронные сети, обученные с помощью алгоритма AdamW и регуляризации, формируют более плавную кривую. В результате точки, находящиеся в “зоне интерполяции” около 0, не попадают точно в +1 или -1, а останавливаются где-то между ними, создавая новые значения.
Эксперименты с двухслойными ReLU-сетями, обученными с разной степенью weight decay, подтвердили эту гипотезу. Чем сильнее применялась регуляризация, тем более сглаженной становилась функция оценки, что усиливало эффект интерполяции. Важно отметить, что даже без явной регуляризации, неявные эффекты градиентных методов обучения также могут приводить к сглаживанию функции оценки.
Значение для практического ИИ
Понимание этого механизма критически важно для дальнейшего развития генеративных моделей. Оно позволяет не только лучше объяснять их работу, но и намеренно управлять их “креативностью”. Например, можно будет тонко настраивать степень сглаживания для контроля между генерацией новых, оригинальных данных и точным воспроизведением существующих. Это особенно актуально для таких областей, как дизайн, разработка лекарств и создание контента, где способность модели создавать нечто действительно новое является ключевым преимуществом.
Ключевые факты
| Аспект | Описание |
|---|---|
| Источник | Google Research Blog, статья “Towards demystifying the creativity of diffusion models” |
| Конференция | ICLR 2026 |
| Основной вывод | “Креативность” диффузионных моделей — математическое следствие сглаживания функции оценки при обучении нейросетей. |
| Механизм | Сглаживание функции оценки приводит к интерполяции между обучающими данными, а не к их точному воспроизведению. |
| Влияние | Позволяет лучше понимать и контролировать генеративные способности моделей. |
Хотя исследование фокусируется на математических основах, его практическое значение для разработчиков и исследователей генеративного ИИ неоспоримо. Возможность точно понимать и контролировать, как именно диффузионные модели генерируют новые данные, откроет двери для более предсказуемых и управляемых творческих инструментов.
Источник: Google Research, Towards demystifying the creativity of diffusion models, https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/