
Исследователи Apple представили Normalizing Trajectory Models, или NTM, — архитектуру для ускорения генеративных моделей. Работа посвящена проблеме, с которой сталкиваются диффузионные системы при сокращении числа шагов генерации: чем крупнее переход между состояниями шума, тем хуже работает предположение о последовательности небольших гауссовских шагов.
Описание опубликовано на исследовательском сайте Apple 8 октября 2026 года. Авторы работы — Jiatao Gu, Tianrong Chen, Ying Shen, David Berthelot, Shuangfei Zhai и Josh Susskind. В заявленной конфигурации NTM способна формировать изображения за четыре шага сэмплирования, сохраняя при этом точное правдоподобие всей генеративной траектории.
Почему сокращение шагов стало проблемой
Классические диффузионные модели обычно начинают с шума и постепенно преобразуют его в изображение. Процесс разбивается на большое количество небольших операций удаления шума. Такое разбиение упрощает обучение: каждый переход между соседними состояниями оказывается сравнительно плавным.
При попытке получить результат за несколько крупных переходов эта логика нарушается. Один шаг должен описывать гораздо более сложное преобразование, а простая модель перехода уже не всегда может передать нужную структуру данных. На практике это приводит к компромиссу между скоростью генерации и качеством результата.
В существующих подходах проблему часто решают с помощью дистилляции, обучения на согласованность или состязательных целей. Такие методы позволяют перенести поведение медленной модели в более быструю, но, как отмечают авторы NTM, при этом обычно теряется исходная вероятностная интерпретация процесса. Иными словами, модель может хорошо генерировать изображения, но уже не обязательно позволяет точно оценить вероятность конкретной траектории.
Как устроена NTM
Normalizing Trajectory Models рассматривает каждый обратный шаг как условный нормализующий поток. В отличие от более простого преобразования, нормализующий поток может описывать сложное обратимое отображение и при этом вычислять его точный якобиан. Это дает возможность обучать модель с использованием точного правдоподобия.
Архитектура NTM объединяет два компонента. Первый — неглубокие обратимые блоки внутри отдельных шагов. Они отвечают за преобразование состояния на конкретном участке траектории. Второй — глубокий параллельный предиктор, который обрабатывает траекторию целиком и помогает модели учитывать зависимости между разными шагами.
Такое сочетание должно решить проблему слишком грубых переходов без полного отказа от likelihood-подхода. Модель не просто имитирует конечный результат многошаговой генерации, а учится описывать сам путь от шума к данным.
По информации Apple, NTM можно обучать с нуля. Также архитектуру можно инициализировать моделями, предварительно обученными в рамках flow matching. Это потенциально снижает стоимость перехода к новой схеме, хотя в опубликованном описании не приведены подробные требования к вычислительным ресурсам, размеру моделей и продолжительности обучения.
Самодистилляция использует модель как учителя
Одной из особенностей подхода авторы называют самодистилляцию. Поскольку NTM сохраняет точное правдоподобие траектории, она может вывести собственную функцию оценки, связанную с распределением модели. На основе этого сигнала обучается более легкий денойзер.
В результате отдельная компактная модель должна воспроизводить поведение исходной архитектуры при меньшем числе операций. Apple сообщает, что такой денойзер способен выдавать качественные образцы за четыре шага.
Это отличается от обычной дистилляции, где быстрая модель перенимает поведение заранее обученного учителя, а качество часто оценивается главным образом по результатам генерации. В NTM траектория и ее вероятностное описание используются как часть самого процесса обучения.
При этом четыре шага — это результат, заявленный авторами в описании исследования, а не универсальная гарантия для любых наборов данных, разрешений или вариантов модели. В доступном материале не указаны полные конфигурации экспериментов, время генерации на конкретном оборудовании и размер итоговой модели.
Что показали сравнения
На тестах генерации изображений, по утверждению исследовательской команды, NTM сравнялась или превзошла сильные базовые методы при генерации всего за четыре шага. Ключевое отличие авторы видят не только в качестве изображений, но и в сохранении точного правдоподобия по всей траектории.
Это дает архитектуре два возможных сценария применения. Первый — ускорение инференса, когда пользователю важнее получить изображение с минимальным числом обращений к модели. Второй — исследовательские и прикладные задачи, где необходимо оценивать вероятность результата, сравнивать траектории или использовать генеративную модель в более широком вероятностном контуре.
Для разработчиков это означает, что скорость нельзя оценивать только по числу шагов. Важны также стоимость одного шага, объем памяти, размер обратимых блоков и задержка параллельного предиктора. Модель с четырьмя шагами не обязательно окажется быстрее другой системы с большим числом шагов, если каждый переход требует существенно больше вычислений.
Что пока остается неясным
Публикация Apple описывает метод и сообщает о результатах на текстово-изобразительных тестах, но доступный анонс не содержит полного набора независимых проверок. В частности, по нему нельзя сделать вывод о преимуществах NTM на всех типах изображений, разрешениях и аппаратных платформах.
Также не приведены данные о сравнении стоимости обучения, потреблении памяти и стабильности при изменении количества шагов после обучения. Эти параметры важны для практического внедрения: архитектура, оптимизированная для четырех шагов, может демонстрировать другой баланс качества и скорости при двух, восьми или большем числе переходов.
До появления кода, подробных таблиц и независимых воспроизведений результаты корректнее рассматривать как заявленные авторами исследования. Основной проверяемый тезис работы — возможность совместить малое число шагов генерации с точным likelihood-обучением, а не доказательство того, что NTM автоматически заменит все современные диффузионные модели.
Подробное описание Normalizing Trajectory Models опубликовано на сайте Apple Machine Learning: https://machinelearning.apple.com/research/normalizing-trajectory-models. Общая информация об исследовательском направлении компании доступна на https://machinelearning.apple.com/. Дополнительный контекст по публикациям и направлениям Apple Machine Learning размещен на https://machinelearning.apple.com/research.
Для практической оценки разработчикам стоит дождаться полного текста экспериментов и сравнивать не только качество изображений, но и реальное время инференса, требования к памяти, стоимость обучения и поведение модели при отличающемся числе шагов.









