Диффузионные модели для генерации видео: архитектура Sora, Imagen Video и Video LDM
Диффузионные модели совершили революцию в генерации изображений, но видео оказалось значительно сложнее. Однокадровая картинка и видеоролик отличаются не масштабом, а качественным скачком: к пространственному разрешению добавляется временная согласованность, требующая от модели понимания физики движения, сохранения объектов между кадрами и предсказания динамики сцен.
В этом разборe два магистральных подхода к генерации видео диффузионными моделями, ключевые архитектурные решения и конкретные цифры из систем, которые сегодня определяют рынок: Sora, Imagen Video, Video LDM.
Два подхода: с нуля и через адаптацию
Все существующие системы генерации видео делятся на два лагеря. Первый: моделирование с нуля, когда архитектура проектируется специально для работы с трёхмерными данными (время × высота × ширина). Второй: адаптация предобученных image-моделей, когда в уже работающий генератор картинок встраиваются временные слои.
Каждый подход решает свою задачу. Моделирование с нуля даёт полный контроль над архитектурой и лучшее качество на длинных последовательностях, но требует огромных размеченных видеодатасетов. Адаптация наследует знания из text-image пар и позволяет экономить на данных, но требует тонкой настройки временной согласованности.
Параметризация и сэмплирование: почему v-prediction важен для видео
Базовый диффузионный процесс добавляет гауссов шум к данным постепенно, создавая последовательность зашумлённых версий от чистого изображения до белого шума. Обратный процесс учится удалять шум шаг за шагом.
Для видео стандартная ε-параметризация (предсказание шума) создаёт проблему цветового сдвига: модель начинает генерировать кадры с неестественными оттенками. Решение: v-параметризация, предложенная Salimans и Ho в 2022 году. Вместо предсказания шума модель предсказывает «скорость» движения в угловых координатах: v = α_t · ε − σ_t · x.
Математически это элегантнее, чем кажется. Если представить зашумлённый сигнал как точку на сфере (где угол φ = arctan(σ/α)), то DDIM-шаг становится простым тригонометрическим тождеством: z_{φ_s} = cos(φ_s − φ_t) · z_{φ_t} + sin(φ_s − φ_t) · v̂_θ(z_{φ_t}). Модель просто сдвигает точку вдоль сферы на предсказанный угол.
На практике v-параметризация устраняет цветовые артефакты и даёт более стабильную генерацию, особенно при многоступенчатом upsampling, важной операции для расширения видео в длину или повышения частоты кадров.
Моделирование с нуля: 3D U-Net и DiT
VDM и разделение пространства-времени
Video Diffusion Models (Ho, Salimans et al., 2022) расширяют классический 2D U-Net до 3D, но делают это аккуратно: каждый слой работает либо только в пространстве, либо только во времени, но не в обоих измерениях одновременно.
Пространственная обработка: обычные 2D свёртки заменяются на 1×3×3, классическая свёртка по высоте и ширине с ядром 1 по временной оси. Пространственное внимание остаётся прежним, только первый тензор (кадры) трактуется как batch-измерение.
Временная обработка: после каждого пространственного attention-блока добавляется временной attention, который выполняет внимание по первому измерению (кадрам), трактуя пространственные оси как batch. Относительное позиционное кодирование отслеживает порядок кадров.
Такое разделение радикально снижает число параметров по сравнению с полноценной 3D свёрткой, сохраняя при этом способность моделировать как пространственные паттерны (текстуры, формы объектов), так и временные (движение, переходы между состояниями).
Imagen Video: каскад из семи моделей
Imagen Video (Ho et al., 2022) довёл идею каскадного сэмплирования до максимума. Система состоит из семи диффузионных моделей: базовая генерирует видео низкого разрешения, затем чередуются три temporal super-resolution модели (увеличение частоты кадров) и три spatial super-resolution модели (увеличение разрешения). Итоговое разрешение: 1280×768 при 24 кадрах в секунду.
Ключевое архитектурное решение Imagen Video: базовая модель обрабатывает все кадры одновременно с общими параметрами, а затем временной слой смешивает активации между кадрами. Авторы показали, что такой подход работает лучше autoregressive подхода, где каждый кадр генерируется последовательно: каскад учитывает контекст всего ролика сразу.
Другой результат: progressive distillation позволяет сократить число шагов сэмплирования вдвое на каждой итерации. В итоге все семь моделей удалось сжать до 8 шагов без заметной потери перцептивного качества, что является важным результатом для production-систем, где латентность имеет значение.
Sora: диффузионный трансформер на spacetime-патчах
Sora (Brooks et al., 2024, OpenAI) отказалась от U-Net в пользу DiT (Diffusion Transformer). Входное видео разбивается на spacetime-патчи, которые трактуются как токены трансформера. Это унифицирует обработку изображений и видео: картинка просто является видео из одного кадра.
Трансформерная архитектура даёт два преимущества. Первое: масштабируемость, трансформеры лучше поддаются параллелизации и увеличению масштаба, чем свёрточные сети. Второе: гибкость, одна модель может работать с разными разрешениями, длинами видео и aspect ratios без архитектурных изменений.
Адаптация image-моделей: от картинок к видео
Make-A-Video: псевдо-3D свёртки
Make-A-Video (Singer et al., 2022, Meta) берёт предобученную text-to-image модель и добавляет временное измерение через псевдо-3D слои. Каждый пространственный 2D свёрточный слой дополняется временным 1D слоем, инициализированным как identity-функция: то есть изначально он не меняет данные, а просто пропускает их.
Псевдо-3D свёртка: сначала применяется 2D свёртка (она генерирует несколько кадров), затем кадры переформатируются и обрабатываются 1D свёрткой по времени. Математически: Conv_P3D = Conv_1D(Conv_2D(h) ∘ T) ∘ T, где ∘ T, транспонирование между пространственными и временными измерениями.
Аналогично, псевдо-3D внимание: после предобученного пространственного attention добавляется временной attention, аппроксимирующий полное spatiotemporal внимание. Такой подход позволяет дообучать только новые временные слои на неразмеченных видео, сохраняя все знания оригинальной text-image модели.
Пайплайн Make-A-Video включает также frame interpolation, сеть, повышающую эффективную частоту кадров путём интерполяции между сгенерированными кадрами, и каскад супер-разрешения до 768×768.
Video LDM: замораживание пространственного бэкбона
Video LDM (Blattmann et al., 2023) сначала обучает LDM-генератор изображений, затем добавляет временные слои и дообучает только их. Пространственные параметры θ остаются замороженными, обновляются только новые временные параметры φ.
Временные слои вставляются между существующими пространственными блоками. Входная последовательность длины T интерпретируется как batch изображений (B·T) для базовой image-модели, а затем переформатируется в видео для временных слоёв. Skip-connection объединяет выход пространственной модели с выходом временных слоёв через обучаемое слияние.
Пайплайн генерации: сначала генерируются ключевые кадры при низкой частоте, затем два шага latent frame interpolation повышают fps. Такой двухэтапный подход дешевле, чем генерация каждого кадра независимо.
Tune-A-Video: one-shot адаптация
Tune-A-Video (Wu et al., 2023) решает другую задачу: не генерацию видео с нуля, а редактирование существующего. Имеется видео с описанием «человек катается на лыжах», и модель должна сгенерировать новое видео по запросу «Человек-Паук катается на лыжах по пляжу».
Архитектура добавляет spatiotemporal attention (ST-Attention), где query берётся из текущего кадра, а key и value из первого кадра и предыдущего. Это обеспечивает временную согласованность: каждый кадр «помнит» контекст начала видео и непосредственного предшественника.
При тонкой настройке обновляются только query-проекции в ST-Attention и Cross-Attention, остальные параметры заморожены. Это сохраняет text-image знания оригинальной модели.
Temporal super-resolution и reconstruction guidance
Для генерации длинных видео или повышения frame rate важно уметь сэмплировать одно видео при условии другого. VDM предложил reconstruction guidance: модель генерирует второе видео x^b, корректируя денoйзинг так, чтобы результат был согласован с первым видео x^a.
Формулировка: скорректированная модель x̃^b_θ(z_t) = x̂^b_θ(z_t) − (w_r · α_t / 2) · ∇_{z^b_t} ||x^a − x̂^a_θ(z_t)||². Градиент реконструкции тянет генерацию к согласованности с условием. Коэффициент w_r > 1 улучшает качество сэмпов.
Тот же метод работает для одновременного кондиционирования на low-resolution видео: расширение до high-resolution через reconstruction guidance даёт результат лучше, чем прямая генерация высокого разрешения.
Training-free адаптация: FreeNoise и пространственный сдвиг
Отдельное направление: адаптация без дополнительного обучения. FreeNoise и подобные методы вставляют в предобученную image-модель механизмы temporal attention, инициализированные нулями, и используют специальные паттерны сэмплирования (шум с временной когерентностью, spatial shifting) для генерации видео без fine-tuning.
Такие подходы позволяют превратить любую text-to-image модель в video-генератор, но качество уступает full fine-tuning, особенно на длинных последовательностях и сложных движениях.
Сравнение подходов: когда что использовать
Моделирование с нуля (VDM, Sora) даёт лучший контроль и качество, но требует огромных вычислительных ресурсов и видеодатасетов. Каскадные архитектуры вроде Imagen Video обеспечивают максимальное разрешение, но сложны в эксплуатации: семь моделей, каждая со своим процессом обучения.
Адаптация image-моделей (Make-A-Video, Video LDM) быстрее в разработке и требует меньше данных: text-image пары уже содержат богатые визуальные знания. Обратная сторона: временная согласованность остаётся «довеском», а не фундаментальным свойством архитектуры.
Tune-A-Video и FreeNoise решают нишевые задачи: быстрое прототипирование и редактирование, но не заменяют полноценные генеративные системы для production.
Практический тренд 2024–2026: трансформерные архитектуры (DiT) вытесняют U-Net. Sora показала, что spacetime-patch подход масштабируется лучше каскадных систем, а единая модель для изображений и видео упрощает пайплайн. Однако Imagen Video и подобные каскады остаются актуальными там, где требуется максимальное разрешение и контроль над каждым этапом.
Часто задаваемые вопросы
Почему v-параметризация лучше ε-параметризации именно для видео?
ε-параметризация предсказывает шум, добавленный к данным, и при многоступенчатом upsampling накапливает цветовые артефакты. v-параметризация предсказывает «скорость» изменения сигнала в угловых координатах, что математически эквивалентно, но численно стабильнее при длинных последовательностях генерации.
Можно ли использовать предобученный Stable Diffusion для генерации видео?
Технически да, через методы вроде Tune-A-Video или FreeNoise, добавляющие временные слои. Но качество будет уступать специализированным video-моделям, особенно на длинных роликах и сложных движениях. Для production лучше использовать Video LDM или аналогичные системы с full fine-tuning временных слоёв.
Почему каскадные модели (Imagen Video) сложнее, чем единый DiT (Sora)?
Каскад из семи моделей (база + 3 temporal SR + 3 spatial SR) требует координации обучения, последовательного inference и передачи состояния между этапами. DiT обрабатывает всё в одном проходе, но требует больше памяти для длинных видео и не даёт такого детального контроля над каждым уровнем разрешения.
Итог
Диффузионные модели для генерации видео прошли путь от каскадов из семи моделей с 8 шагами сэмплирования до единых трансформеров на spacetime-патчах. Два подхода: моделирование с нуля и адаптация image-моделей, решают разные задачи и продолжают эволюционировать параллельно.
Если вы работаете над production-системой генерации видео, начните с Video LDM-подхода: он быстрее в разработке, наследует знания из image-моделей и даёт разумное качество без огромных видеодатасетов. Для максимального разрешения и контроля рассмотрите каскадную архитектуру. Для масштабируемости и гибкости выбирайте DiT на spacetime-патчах, как в Sora.
Изучите исходную статью Lilian Weng «Diffusion Models for Video Generation»: это наиболее полный технический обзор с математическими деталями каждого подхода.