Запись архива

Sora: как OpenAI представила видео как «патчи» пространства-времени

Разбираем февральский отчет OpenAI о Sora: зачем видео сжимают в латенты, как из них делают пространственно-временные патчи, почему это похоже на токены LLM и где заканчиваются реальные результаты.

Схема работы Sora: видео сжимается в латентное пространство, режется на пространственно-временные патчи, обрабатывается diffusion transformer и декодируется обратно в ролик

15 февраля 2024 года OpenAI опубликовала технический отчет Video generation models as world simulators, где впервые показала Sora. Это был не полный научный paper с параметрами модели, объемами датасета и таблицей бенчмарков, а исследовательский отчет о ключевой идее: видео и изображения можно представить как единый поток латентных «патчей» пространства-времени и обучать на нем diffusion transformer. Важна именно эта архитектурная мысль, а не только впечатляющие демо: она переносит логику токенов и масштабирования из LLM в видеогенерацию.

Ниже мы разбираем исторический срез именно на 15 февраля 2024 года. Для проверки масштаба и границ claims мы будем иногда сопоставлять его с более поздними документами OpenAI от 9 декабря 2024 года, когда Sora перешла из research preview в продуктовый контур, и с текущим статусом сервиса: OpenAI и Help Center прямо указывают, что веб- и app-версия Sora были прекращены 26 апреля 2026 года.

Коротко

  • Главная идея Sora в отчете OpenAI — не «видео по тексту» само по себе, а единое представление изображений и видео как spacetime latent patches.
  • Архитектурно Sora состоит из трех знакомых блоков: сжатие видео в латентное пространство, разбиение на патчи, затем денойзинг этих патчей трансформером в рамках diffusion-процесса.
  • Такой дизайн позволяет одной и той же модели работать с разной длительностью, разрешением и соотношением сторон, а изображение трактовать как видео из одного кадра.
  • Отчет 15 февраля 2024 года в основном качественный: OpenAI показывает примеры и failure modes, но не публикует полные training details и не дает стандартной таблицы сравнений с конкурентами.
  • Исторически важно не смешивать research preview и продукт: в феврале 2024 OpenAI показывала генерацию до одной минуты HD, а в документах от 9 декабря 2024 публичный продукт описан как до 1080p и до 20 секунд.

Контекст

К началу 2024 года text-to-video уже перестал быть экзотикой. До Sora существовали сильные diffusion-подходы для видео, включая Imagen Video, Align Your Latents и другие работы, но OpenAI в своем отчете подчеркивает общий структурный предел предшественников: многие системы работали с короткими роликами, фиксированными размерами или агрессивным приведением данных к стандартному формату.

Именно на эту проблему и направлен отчет Sora. Вместо пайплайна, где под каждый формат подбирается отдельная схема, OpenAI предлагает унифицировать визуальные данные так, чтобы и изображение, и вертикальное видео, и широкий ролик, и более длинная последовательность выглядели для модели как один и тот же тип входа — последовательность патчей.

Здесь важно правильно понимать масштаб утверждений. Формулировка про world simulators вынесена в заголовок и задает амбицию работы, но сам текст отчета осторожнее: он описывает метод, качественные примеры и набор ограничений. Это не доказательство того, что Sora уже стала надежным симулятором физического мира, а скорее аргумент OpenAI, что масштабируемые видеомодели могут двигаться в эту сторону.

Есть и еще один исторический нюанс. Отчет от 15 февраля 2024 года описывает research preview; поздние документы OpenAI от 9 декабря 2024 года показывают, что в продукт дошла не вся исследовательская «оболочка». Поэтому корректнее читать Sora не как «готовую замену видеоредактору», а как исследовательский прототип архитектурного класса.

Метод

1. Сначала видео не генерируют в пикселях

OpenAI не работает напрямую с сырыми кадрами во всей их размерности. В отчете Sora сначала используется сеть сжатия видео: она переводит исходный ролик в более компактное латентное пространство, где данные уже ужаты и по времени, и по пространству. Это знакомый ход из работ по latent diffusion: генерация в латентах дешевле и масштабируется лучше, чем в полном пиксельном пространстве.

Практически это означает следующее: вместо того чтобы заставлять трансформер «думать» о каждом пикселе каждого кадра, модель работает с более компактным представлением сцены и движения. Именно на этом слое появляется главный объект статьи — пространственно-временные патчи.

2. Затем латентное видео режут на кубики во времени и пространстве

После сжатия видео разбивается на spacetime patches — небольшие блоки, которые покрывают не только область по ширине и высоте, но и фрагмент по времени. Если нужна интуиция, это не «плитки картинки», а скорее маленькие трехмерные кубики из латентного видеотензора.

Это и есть главный перенос идеи токенизации из языковых моделей в видео. В LLM текст превращается в токены; в Sora сжатое видео превращается в последовательность визуальных токенов-патчей. Аналогия не полная, но полезная: после этого трансформер получает единый тип входа, с которым можно делать то, что он уже хорошо умеет, — моделировать большие последовательности.

Отдельно важно, что изображения в этой схеме не требуют отдельной архитектуры. В отчете OpenAI прямо пишет, что изображение можно трактовать как видео из одного кадра. Это делает модель изначально мультимодальной внутри визуального контура: один и тот же механизм работает и для статичного изображения, и для движущейся сцены.

3. Денойзинг делает diffusion transformer

Sora описана как diffusion model и одновременно как diffusion transformer. Логика стандартная для диффузионных генераторов: на вход подаются зашумленные патчи плюс условие, например текстовый промпт; модель учится предсказывать исходные «чистые» патчи, постепенно снимая шум.

Новизна здесь не в самой диффузии, а в сочетании с patch-представлением и трансформером. OpenAI опирается на уже существующую линию работ — от ViT и ViViT до NaViT и DiT, — где patches и transformer-архитектуры показали, что хорошо переносятся на визуальные данные и масштабирование. Sora по сути говорит: давайте проделаем этот трюк для видео, но еще и в латентном пространстве.

raw video -> video compression network -> latent video -> spacetime patches -> noisy patch grid + text condition -> diffusion transformer -> clean latent patches -> decoder -> final video

4. Почему это дает гибкость по длительности и формату

Самая практическая часть метода — независимость от фиксированного «канваса». В отчете OpenAI пишет, что модель обучается на данных в нативных размерах и соотношениях сторон, а на инференсе размер ролика можно контролировать тем, как именно вы раскладываете случайно инициализированные патчи в сетку нужного размера.

Отсюда и ключевое следствие: одна и та же модель может работать с разными длительностями, разрешениями и аспектами кадра. В феврале 2024 года OpenAI заявляла, что Sora способна генерировать видео до одной минуты высокой четкости, а в самом отчете отдельно демонстрировала широкий 1920×1080 и вертикальный 1080×1920 форматы. Позже, уже в системной карте и продуктовых материалах от 9 декабря 2024 года, публичный контур был зафиксирован уже скромнее: до 1080p и до 20 секунд. Это не противоречие, а разница между исследовательской демонстрацией и публичным deployment envelope.

5. Текстовое понимание усиливают recaptioning и prompt expansion

Еще один важный слой — не архитектура видео как таковая, а качество текстового условия. В разделе Language understanding OpenAI пишет, что перенесла на видео технику re-captioning, ранее использованную в DALL·E 3: сначала обучается подробный captioner, затем он переподписывает обучающий набор более детальными описаниями.

Идея проста: многие веб-подписи слишком короткие, шумные или неточные для обучения модели, которая должна следовать сложному промпту. Более подробные synthetic captions улучшают связку между текстом и визуальным результатом. Дополнительно, как и в DALL·E 3, OpenAI использует GPT для разворачивания коротких пользовательских подсказок в более длинные описания перед подачей в видеомодель.

6. Sora — это не только text-to-video

По самому отчету видно, что OpenAI замышляла Sora не как узкий генератор «текст → ролик». В нем отдельно показаны режимы с image input и video input: анимация статичных изображений, продолжение видео вперед и назад по времени, создание бесшовных циклов, video-to-video editing через SDEdit и интерполяция между роликами.

Это важный практический момент. Архитектура с единым patch-представлением делает возможной не только генерацию с нуля, но и семейство операций редактирования. То есть Sora с самого начала задумывалась как единая визуальная модель для генерации и трансформации, а не просто как «видеоверсия DALL·E».

Результаты

Проблема чтения отчета Sora в том, что он почти не дает классической числовой таблицы качества. Поэтому самый честный способ подвести результаты — разделить исследовательские claims, поздний продуктовый срез и то, что реально следует из источников.

Аспект Что зафиксировано 15 февраля 2024 Что видно в документах 9 декабря 2024 Практический вывод
Базовая архитектура OpenAI описывает Sora как diffusion transformer, работающий на spacetime patches латентных видео и изображений. System Card повторяет ту же базовую схему: diffusion-процесс, transformer-архитектура и обработка многих кадров сразу. Ключевой исследовательский тезис сохранился до продуктового описания: core-идея модели не была отброшена.
Диапазон генерации В техническом отчете и на исследовательской странице OpenAI пишет про разные длительности, разрешения и соотношения сторон, включая ролики до одной минуты HD. В System Card и product announcement публичный продукт уже описан как до 1080p и до 20 секунд. Research preview не равен публичному продукту; при чтении Sora это различие принципиально.
Типы входов Отчет показывает text-to-video, image-to-video, video extension, looping и video-to-video editing. System Card прямо говорит о text, image и video inputs. Sora изначально проектировалась как единая visual generation/editing system.
Ограничения модели Отчет признает ошибки физики, сбои причинности, спонтанное появление объектов и incoherence на длинных выборках. Исследовательская страница с примерами показывает те же типы слабостей; поздние safety-материалы фокусируются уже на mitigations, а не на заявлении, что эти проблемы исчезли. Фраза про «симулятор мира» в 2024 году была скорее исследовательской рамкой, чем строгим эмпирическим доказательством.

Если смотреть на результаты строго, OpenAI убедительно показала одну вещь: patch-based latent video modeling на трансформере действительно дает очень широкий класс визуальных операций внутри одной схемы. Но отчет не доказывает другой, более сильный тезис: что такая модель уже надежно понимает физический мир, причинность и долгосрочную динамику.

Интерпретация

Наш комментарий

На наш взгляд, самая важная часть Sora — не «реалистичность роликов» как таковая. Ее могли бы улучшать и другие лаборатории разными инженерными путями. Долгоживущая идея здесь другая: представить видео как последовательность токеноподобных визуальных единиц и тем самым сделать видеогенерацию похожей на обучение foundation-модели, а не на набор отдельных трюков под каждый формат.

Из этого следуют два практических вывода для инженеров. Первый: в мультимодальных системах граница между изображением и видео становится скорее вопросом длины последовательности, чем отдельного класса данных. Второй: если представление действительно унифицировано, то generation, editing, extension и interpolation становятся разными режимами одной модели, а не набором независимых инструментов.

Но не стоит переоценивать вторую половину риторики OpenAI про «world simulator». Качественные примеры могут выглядеть очень убедительно, особенно когда модель хорошо держит стиль, камеру и краткосрочную динамику. Однако убедительное изображение физики и надежная внутренняя модель физики — не одно и то же. Сам отчет это, по сути, и признает, перечисляя свои failure modes.

Ограничения

  • Нет полной воспроизводимости. В отчете OpenAI прямо отмечает, что model and implementation details не включены. Для практиков это означает отсутствие многих деталей, которые обычно нужны для репликации: состава данных, compute budget, размеров модели, точных абляций.
  • Результаты в основном качественные. Sora показывает сильные демо, но не дает стандартной таблицы с единым benchmark setup против предыдущих систем. Поэтому любые выводы о превосходстве над всем рынком надо формулировать осторожно.
  • Ошибки физики признаны самими авторами. OpenAI пишет, что Sora не всегда корректно моделирует разрушение стекла, изменение состояния объектов после взаимодействия, причинно-следственные связи и долгие последовательности.
  • Нативные размеры и aspect ratios выглядят убедительно, но без подробных абляций. Отчет утверждает, что обучение на исходных форматах улучшает композицию относительно квадратных кропов, однако не публикует полноценного числового разбора этого эффекта.
  • Research preview и продукт нельзя смешивать. Февральский тезис про ролики до одной минуты высокой четкости не означает, что именно такой режим был доступен публичным пользователям в декабре 2024 года. В System Card публичный контур описан уже как 1080p и до 20 секунд.
  • Текущий статус сервиса другой, чем в 2024 году. По состоянию на 26 апреля 2026 года OpenAI указывает, что веб- и app-версия Sora более не доступны. Поэтому сегодня Sora стоит читать как исторически важный исследовательский артефакт, а не как актуальный потребительский продукт.

Заключение

Если убрать демонстрационные ролики и громкую формулу про «симулятор мира», Sora остается очень важной именно как архитектурная идея. OpenAI показала, что видео и изображения можно свести к единому латентному patch-представлению и обучать на нем крупную diffusion transformer-модель с гибкостью по длительности, разрешению и типу входа.

Но столь же важно помнить, чего отчет не доказывает. Он не дает полной воспроизводимости, не закрывает вопрос физического понимания и не заменяет строгую количественную оценку. Поэтому правильный вывод о Sora в версии 15 февраля 2024 года звучит так: это сильный исследовательский шаг к foundation-подходу в видеогенерации, а не окончательное доказательство того, что модель уже «понимает мир».

Источники

FAQ

Что значит «патчи пространства-времени» в Sora?

Это небольшие блоки данных, которые покрывают не только область кадра по ширине и высоте, но и кусок по времени. После сжатия видео в латентное пространство именно такие блоки становятся «токенами» для трансформера.

Sora — это просто DiT для видео?

Не совсем. Sora действительно опирается на логику diffusion transformers, но важен весь стек целиком: видео-компрессия в латенты, единое patch-представление для изображений и видео, обучение на нативных форматах и recaptioning для текстового контроля.

Доказывает ли Sora, что модель понимает физику мира?

Нет. Отчет OpenAI показывает убедительные примеры, но сам же перечисляет ошибки физики, причинности и согласованности длинных сцен. Поэтому корректнее говорить о частичной симуляции некоторых аспектов мира, а не о надежном физическом моделировании.

Почему в статье упомянута одна минута видео, если публичный продукт позже ограничивался 20 секундами?

Потому что это разные исторические срезы. В исследовательском отчете от 15 февраля 2024 года OpenAI пишет о генерации до одной минуты HD, а в System Card и product materials от 9 декабря 2024 года публичный контур описан как до 1080p и до 20 секунд.

Читайте также