15 февраля 2024 года OpenAI опубликовала технический отчет Video generation models as world simulators, где впервые показала Sora. Это был не полный научный paper с параметрами модели, объемами датасета и таблицей бенчмарков, а исследовательский отчет о ключевой идее: видео и изображения можно представить как единый поток латентных «патчей» пространства-времени и обучать на нем diffusion transformer. Важна именно эта архитектурная мысль, а не только впечатляющие демо: она переносит логику токенов и масштабирования из LLM в видеогенерацию.
Ниже мы разбираем исторический срез именно на 15 февраля 2024 года. Для проверки масштаба и границ claims мы будем иногда сопоставлять его с более поздними документами OpenAI от 9 декабря 2024 года, когда Sora перешла из research preview в продуктовый контур, и с текущим статусом сервиса: OpenAI и Help Center прямо указывают, что веб- и app-версия Sora были прекращены 26 апреля 2026 года.
Коротко
- Главная идея Sora в отчете OpenAI — не «видео по тексту» само по себе, а единое представление изображений и видео как spacetime latent patches.
- Архитектурно Sora состоит из трех знакомых блоков: сжатие видео в латентное пространство, разбиение на патчи, затем денойзинг этих патчей трансформером в рамках diffusion-процесса.
- Такой дизайн позволяет одной и той же модели работать с разной длительностью, разрешением и соотношением сторон, а изображение трактовать как видео из одного кадра.
- Отчет 15 февраля 2024 года в основном качественный: OpenAI показывает примеры и failure modes, но не публикует полные training details и не дает стандартной таблицы сравнений с конкурентами.
- Исторически важно не смешивать research preview и продукт: в феврале 2024 OpenAI показывала генерацию до одной минуты HD, а в документах от 9 декабря 2024 публичный продукт описан как до 1080p и до 20 секунд.
Контекст
К началу 2024 года text-to-video уже перестал быть экзотикой. До Sora существовали сильные diffusion-подходы для видео, включая Imagen Video, Align Your Latents и другие работы, но OpenAI в своем отчете подчеркивает общий структурный предел предшественников: многие системы работали с короткими роликами, фиксированными размерами или агрессивным приведением данных к стандартному формату.
Именно на эту проблему и направлен отчет Sora. Вместо пайплайна, где под каждый формат подбирается отдельная схема, OpenAI предлагает унифицировать визуальные данные так, чтобы и изображение, и вертикальное видео, и широкий ролик, и более длинная последовательность выглядели для модели как один и тот же тип входа — последовательность патчей.
Здесь важно правильно понимать масштаб утверждений. Формулировка про world simulators вынесена в заголовок и задает амбицию работы, но сам текст отчета осторожнее: он описывает метод, качественные примеры и набор ограничений. Это не доказательство того, что Sora уже стала надежным симулятором физического мира, а скорее аргумент OpenAI, что масштабируемые видеомодели могут двигаться в эту сторону.
Есть и еще один исторический нюанс. Отчет от 15 февраля 2024 года описывает research preview; поздние документы OpenAI от 9 декабря 2024 года показывают, что в продукт дошла не вся исследовательская «оболочка». Поэтому корректнее читать Sora не как «готовую замену видеоредактору», а как исследовательский прототип архитектурного класса.
Метод
1. Сначала видео не генерируют в пикселях
OpenAI не работает напрямую с сырыми кадрами во всей их размерности. В отчете Sora сначала используется сеть сжатия видео: она переводит исходный ролик в более компактное латентное пространство, где данные уже ужаты и по времени, и по пространству. Это знакомый ход из работ по latent diffusion: генерация в латентах дешевле и масштабируется лучше, чем в полном пиксельном пространстве.
Практически это означает следующее: вместо того чтобы заставлять трансформер «думать» о каждом пикселе каждого кадра, модель работает с более компактным представлением сцены и движения. Именно на этом слое появляется главный объект статьи — пространственно-временные патчи.
2. Затем латентное видео режут на кубики во времени и пространстве
После сжатия видео разбивается на spacetime patches — небольшие блоки, которые покрывают не только область по ширине и высоте, но и фрагмент по времени. Если нужна интуиция, это не «плитки картинки», а скорее маленькие трехмерные кубики из латентного видеотензора.
Это и есть главный перенос идеи токенизации из языковых моделей в видео. В LLM текст превращается в токены; в Sora сжатое видео превращается в последовательность визуальных токенов-патчей. Аналогия не полная, но полезная: после этого трансформер получает единый тип входа, с которым можно делать то, что он уже хорошо умеет, — моделировать большие последовательности.
Отдельно важно, что изображения в этой схеме не требуют отдельной архитектуры. В отчете OpenAI прямо пишет, что изображение можно трактовать как видео из одного кадра. Это делает модель изначально мультимодальной внутри визуального контура: один и тот же механизм работает и для статичного изображения, и для движущейся сцены.
3. Денойзинг делает diffusion transformer
Sora описана как diffusion model и одновременно как diffusion transformer. Логика стандартная для диффузионных генераторов: на вход подаются зашумленные патчи плюс условие, например текстовый промпт; модель учится предсказывать исходные «чистые» патчи, постепенно снимая шум.
Новизна здесь не в самой диффузии, а в сочетании с patch-представлением и трансформером. OpenAI опирается на уже существующую линию работ — от ViT и ViViT до NaViT и DiT, — где patches и transformer-архитектуры показали, что хорошо переносятся на визуальные данные и масштабирование. Sora по сути говорит: давайте проделаем этот трюк для видео, но еще и в латентном пространстве.
raw video -> video compression network -> latent video -> spacetime patches -> noisy patch grid + text condition -> diffusion transformer -> clean latent patches -> decoder -> final video
4. Почему это дает гибкость по длительности и формату
Самая практическая часть метода — независимость от фиксированного «канваса». В отчете OpenAI пишет, что модель обучается на данных в нативных размерах и соотношениях сторон, а на инференсе размер ролика можно контролировать тем, как именно вы раскладываете случайно инициализированные патчи в сетку нужного размера.
Отсюда и ключевое следствие: одна и та же модель может работать с разными длительностями, разрешениями и аспектами кадра. В феврале 2024 года OpenAI заявляла, что Sora способна генерировать видео до одной минуты высокой четкости, а в самом отчете отдельно демонстрировала широкий 1920×1080 и вертикальный 1080×1920 форматы. Позже, уже в системной карте и продуктовых материалах от 9 декабря 2024 года, публичный контур был зафиксирован уже скромнее: до 1080p и до 20 секунд. Это не противоречие, а разница между исследовательской демонстрацией и публичным deployment envelope.
5. Текстовое понимание усиливают recaptioning и prompt expansion
Еще один важный слой — не архитектура видео как таковая, а качество текстового условия. В разделе Language understanding OpenAI пишет, что перенесла на видео технику re-captioning, ранее использованную в DALL·E 3: сначала обучается подробный captioner, затем он переподписывает обучающий набор более детальными описаниями.
Идея проста: многие веб-подписи слишком короткие, шумные или неточные для обучения модели, которая должна следовать сложному промпту. Более подробные synthetic captions улучшают связку между текстом и визуальным результатом. Дополнительно, как и в DALL·E 3, OpenAI использует GPT для разворачивания коротких пользовательских подсказок в более длинные описания перед подачей в видеомодель.
6. Sora — это не только text-to-video
По самому отчету видно, что OpenAI замышляла Sora не как узкий генератор «текст → ролик». В нем отдельно показаны режимы с image input и video input: анимация статичных изображений, продолжение видео вперед и назад по времени, создание бесшовных циклов, video-to-video editing через SDEdit и интерполяция между роликами.
Это важный практический момент. Архитектура с единым patch-представлением делает возможной не только генерацию с нуля, но и семейство операций редактирования. То есть Sora с самого начала задумывалась как единая визуальная модель для генерации и трансформации, а не просто как «видеоверсия DALL·E».
Результаты
Проблема чтения отчета Sora в том, что он почти не дает классической числовой таблицы качества. Поэтому самый честный способ подвести результаты — разделить исследовательские claims, поздний продуктовый срез и то, что реально следует из источников.
| Аспект | Что зафиксировано 15 февраля 2024 | Что видно в документах 9 декабря 2024 | Практический вывод |
|---|---|---|---|
| Базовая архитектура | OpenAI описывает Sora как diffusion transformer, работающий на spacetime patches латентных видео и изображений. | System Card повторяет ту же базовую схему: diffusion-процесс, transformer-архитектура и обработка многих кадров сразу. | Ключевой исследовательский тезис сохранился до продуктового описания: core-идея модели не была отброшена. |
| Диапазон генерации | В техническом отчете и на исследовательской странице OpenAI пишет про разные длительности, разрешения и соотношения сторон, включая ролики до одной минуты HD. | В System Card и product announcement публичный продукт уже описан как до 1080p и до 20 секунд. | Research preview не равен публичному продукту; при чтении Sora это различие принципиально. |
| Типы входов | Отчет показывает text-to-video, image-to-video, video extension, looping и video-to-video editing. | System Card прямо говорит о text, image и video inputs. | Sora изначально проектировалась как единая visual generation/editing system. |
| Ограничения модели | Отчет признает ошибки физики, сбои причинности, спонтанное появление объектов и incoherence на длинных выборках. | Исследовательская страница с примерами показывает те же типы слабостей; поздние safety-материалы фокусируются уже на mitigations, а не на заявлении, что эти проблемы исчезли. | Фраза про «симулятор мира» в 2024 году была скорее исследовательской рамкой, чем строгим эмпирическим доказательством. |
Если смотреть на результаты строго, OpenAI убедительно показала одну вещь: patch-based latent video modeling на трансформере действительно дает очень широкий класс визуальных операций внутри одной схемы. Но отчет не доказывает другой, более сильный тезис: что такая модель уже надежно понимает физический мир, причинность и долгосрочную динамику.
Интерпретация
Наш комментарий
На наш взгляд, самая важная часть Sora — не «реалистичность роликов» как таковая. Ее могли бы улучшать и другие лаборатории разными инженерными путями. Долгоживущая идея здесь другая: представить видео как последовательность токеноподобных визуальных единиц и тем самым сделать видеогенерацию похожей на обучение foundation-модели, а не на набор отдельных трюков под каждый формат.
Из этого следуют два практических вывода для инженеров. Первый: в мультимодальных системах граница между изображением и видео становится скорее вопросом длины последовательности, чем отдельного класса данных. Второй: если представление действительно унифицировано, то generation, editing, extension и interpolation становятся разными режимами одной модели, а не набором независимых инструментов.
Но не стоит переоценивать вторую половину риторики OpenAI про «world simulator». Качественные примеры могут выглядеть очень убедительно, особенно когда модель хорошо держит стиль, камеру и краткосрочную динамику. Однако убедительное изображение физики и надежная внутренняя модель физики — не одно и то же. Сам отчет это, по сути, и признает, перечисляя свои failure modes.
Ограничения
- Нет полной воспроизводимости. В отчете OpenAI прямо отмечает, что model and implementation details не включены. Для практиков это означает отсутствие многих деталей, которые обычно нужны для репликации: состава данных, compute budget, размеров модели, точных абляций.
- Результаты в основном качественные. Sora показывает сильные демо, но не дает стандартной таблицы с единым benchmark setup против предыдущих систем. Поэтому любые выводы о превосходстве над всем рынком надо формулировать осторожно.
- Ошибки физики признаны самими авторами. OpenAI пишет, что Sora не всегда корректно моделирует разрушение стекла, изменение состояния объектов после взаимодействия, причинно-следственные связи и долгие последовательности.
- Нативные размеры и aspect ratios выглядят убедительно, но без подробных абляций. Отчет утверждает, что обучение на исходных форматах улучшает композицию относительно квадратных кропов, однако не публикует полноценного числового разбора этого эффекта.
- Research preview и продукт нельзя смешивать. Февральский тезис про ролики до одной минуты высокой четкости не означает, что именно такой режим был доступен публичным пользователям в декабре 2024 года. В System Card публичный контур описан уже как 1080p и до 20 секунд.
- Текущий статус сервиса другой, чем в 2024 году. По состоянию на 26 апреля 2026 года OpenAI указывает, что веб- и app-версия Sora более не доступны. Поэтому сегодня Sora стоит читать как исторически важный исследовательский артефакт, а не как актуальный потребительский продукт.
Заключение
Если убрать демонстрационные ролики и громкую формулу про «симулятор мира», Sora остается очень важной именно как архитектурная идея. OpenAI показала, что видео и изображения можно свести к единому латентному patch-представлению и обучать на нем крупную diffusion transformer-модель с гибкостью по длительности, разрешению и типу входа.
Но столь же важно помнить, чего отчет не доказывает. Он не дает полной воспроизводимости, не закрывает вопрос физического понимания и не заменяет строгую количественную оценку. Поэтому правильный вывод о Sora в версии 15 февраля 2024 года звучит так: это сильный исследовательский шаг к foundation-подходу в видеогенерации, а не окончательное доказательство того, что модель уже «понимает мир».
Источники
- Video generation models as world simulators | OpenAI
- Sora: Creating video from text | OpenAI
- Sora System Card | OpenAI
- Sora is here | OpenAI
- What to know about the Sora discontinuation | OpenAI Help Center
- Scalable Diffusion Models with Transformers
- Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution
- ViViT: A Video Vision Transformer
- An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale
- High-Resolution Image Synthesis With Latent Diffusion Models
- Improving Image Generation with Better Captions
FAQ
Что значит «патчи пространства-времени» в Sora?
Это небольшие блоки данных, которые покрывают не только область кадра по ширине и высоте, но и кусок по времени. После сжатия видео в латентное пространство именно такие блоки становятся «токенами» для трансформера.
Sora — это просто DiT для видео?
Не совсем. Sora действительно опирается на логику diffusion transformers, но важен весь стек целиком: видео-компрессия в латенты, единое patch-представление для изображений и видео, обучение на нативных форматах и recaptioning для текстового контроля.
Доказывает ли Sora, что модель понимает физику мира?
Нет. Отчет OpenAI показывает убедительные примеры, но сам же перечисляет ошибки физики, причинности и согласованности длинных сцен. Поэтому корректнее говорить о частичной симуляции некоторых аспектов мира, а не о надежном физическом моделировании.
Почему в статье упомянута одна минута видео, если публичный продукт позже ограничивался 20 секундами?
Потому что это разные исторические срезы. В исследовательском отчете от 15 февраля 2024 года OpenAI пишет о генерации до одной минуты HD, а в System Card и product materials от 9 декабря 2024 года публичный контур описан как до 1080p и до 20 секунд.
