OPSD-V: Как научить видео-модель генерировать в реальном времени без деградации

OPSD-V: Как научить видео-модель генерировать в реальном времени без деградации

Видеогенерация переживает момент, похожий на переход LLM от пакетной обработки к стримингу токенов. Модели вроде Wan2.1 и HunyuanVideo генерируют потрясающие клипы, но делают это «оффлайн» — загружаешь промпт, ждёшь, получаешь готовое видео целиком. Ни о каком интерактивном общении, realtime-превью или потоковой генерации речь не идёт.

Авторегрессивные модели пытаются это изменить: они генерируют видео чанками, каждый следующий кадр достраивается на основе предыдущих через KV-кэш — ровно как GPT дописывает текст токен за токеном. Но на практике при длинных роликах (>5 секунд) качество стремительно падает: движение затухает, появляется мерцание, семантика «уплывает». Исследователи из команды OPSD-V предлагают решение — on-policy self-distillation с учётом состояния кэша, и результаты впечатляют.

Почему авторегрессивная генерация видео — это сложно

Современные видео-диффузионные модели используют bidirectional attention: каждый кадр «видит» все остальные и корректирует шум с учётом полного контекста. Это отлично для оффлайн-генерации, но полностью ломается в потоковом режиме — нельзя ждать весь ролик, чтобы начать его показывать.

Авторегрессивный подход решает это радикально: модель факторизует распределение видео как произведение условных вероятностей чанков. Каждый чанк генерируется из шума за несколько шагов денoйзинга, опираясь на KV-кэш из предыдущих чанков. Звучит просто, но на деле выявляется фундаментальная проблема — cache drift.

Когда студент-модель (скомпилированная few-step версия) генерирует чанк за чанком, её собственные выходы накапливают ошибки. К пятому-шестому чанку KV-кэш заполнен не «настоящим» видео, а всё более артефактным продуктом самой модели. Движение ослабевает, текстуры размываются, а к десятому чанку видео превращается в кашу из пикселей.

Суть метода OPSD-V

Ключевая идея OPSD-V (On-Policy Self-Distillation for Video) элегантно проста: студент продолжает генерировать «по-своему» (on-policy), но учитель оценивает те же самые зашумлённые состояния с другим кэшем — где старая история заменена реальными видео-чанками, а не сгенерированными.

Это создаёт асимметрию, которая и решает проблему cache drift. Студент обучается на своих собственных ошибках (on-policy rollout), но получает корректные градиенты от учителя, который «видит» чистый контекст. Формально это выглядит так: первый чанк — реальный (shared prefix), далее студент генерирует чанк i, записывает его в свой кэш, а учитель оценивает тот же зашумлённый латент, но с кэшем, где всё до чанка i-1 — реальное видео.

На практике это означает, что модель учится компенсировать собственные артефакты, не теряя при этом связности с предыдущими кадрами. Это принципиально отличается от DMD-подходов, где учитель — это отдельная коротко-клиповая диффузионная модель, ограниченная по временному горизонту и не способная supervise длинные авторегрессивные.rollouts.

Архитектурные детали

Базовые модели — Wan2.1 и LongLive, обе представляют собой causal video diffusion transformers. OPSD-V применяется как post-training: берётся уже обученная few-step модель (скомпилированная из полношаговой через CausVid или аналогичный метод) и дообучается на 3800 одноминутных видео в разрешении 480p.

Датасет покрывает природные ландшафты, значительные движения камеры и человеческие сцены — всё то, что создаёт максимальную нагрузку на авторегрессивную генерацию. Фильтрация по optical flow убирает низкодинамичные и нестабильные образцы. VAE-энкодер от Wan2.1 переводит видео в латентные чанки.

Важный нюанс — attention-sink inference. При генерации длинных роликов attention-механизм сталкивается с тем, что первые токены (и чанки) получают непропорционально большой вес. OPSD-V использует специальный режим инференса, который балансирует внимание между «sink»-токенами и текущим контекстом, что критично для сохранения качества на 10+ чанках.

Обучение использует 4-шаговый сэмплер с фиксированным расписанием таймстепов. Студент и учитель разделяют один и тот же velocity predictor f_θ — разница только в состоянии кэша. Loss вычисляется как MSE между предсказаниями студента и учителя по зашумлённым латентам на каждом денoйзинг-шаге.

Результаты: что изменилось

Количественные метрики показывают устойчивое улучшение по всем ключевым показателям. На базе LongLive OPSD-V снижает FVD (Fréchet Video Distance) и улучшает CLIP-score согласованности с текстом. Но интереснее qualitative результаты — визуальное сравнение показывает, что деградация на длинных rollout'ах практически исчезает.

Типичные артефакты базовых моделей — ослабление движения к 6-8 чанку, temporal flickering, семантический дрифт (объекты «плывут», фон размывается) — выражено уменьшаются. OPSD-V сохраняет motion dynamics и визуальное качество на протяжении всего ролика. При этом модель использует те же 4 шага денoйзинга на чанк — никакого замедления инференса.

Особенно показателен результат на «сложных» промптах с большим движением камеры. Базовая модель начинает терять консистентность сцены уже к пятому чанку, тогда как OPSD-V удерживает геометрию и перспективу на протяжении 10+ чанков. Это прямое следствие cache-aware дистилляции — модель научилась полагаться на «чистую» информацию из реального контекста, а не на зашумлённый кэш собственных генераций.

Почему это важно для индустрии

Переход от оффлайн к realtime видео-генерации — это не просто техническая деталь, а условие для целого класса приложений. Интерактивные NPC с живой анимацией, виртуальные ассистенты с мимикой в реальном времени, потоковая генерация для metaverse-платформ — всё это требует модели, которая не деградирует со временем.

OPSD-V решает именно эту проблему. Метод пост-тренинга означает, что его можно применить к уже существующим моделям (Wan2.1, LongLive и, потенциально, будущим) без пересчёта с нуля. Стоимость — 3800 одноминутных видео на 480p, что по меркам обучения видео-фондационных моделей крайне скромно.

При этом метод принципиально отличается от предыдущих подходов. DMD-дистилляция использует коротко-клиповый teacher, который не может supervise длинные rollout'ы. Teacher forcing с реальными видео ломает on-policy распределение. OPSD-V находит золотую середину: студент идёт по своей траектории, но учится на корректных градиентах от учителя с «привилегированным» реальным контекстом.

Часто задаваемые вопросы

Чем OPSD-V отличается от обычной дистилляции видео-моделей?

Классическая дистилляция (вроде CausVid) сжимает полношаговую модель в few-step, но не решает проблему накопления ошибок при авторегрессивной генерации. OPSD-V — это надстройка именно над few-step моделями, которая устраняет cache drift через on-policy обучение с асимметричным кэшем учителя.

Можно ли применить OPSD-V к текстовым LLM?

Принцип on-policy self-distillation (как в distillation из собственных rollout'ов) уже используется в RLHF и self-play для LLM. Концепция cache-aware учителя — где учитель «видит» правильный контекст, а студент — свой — потенциально переносима на текстовую область, но требует адаптации под дискретную природу токенов.

Какие ограничения метода?

Авторы отмечают, эффективность OPSD-V зависит от качества и разнообразия long-video датасета. 3800 видео — относительно немного, и масштабирование объёма данных вероятно даст дальнейший прирост. Кроме того, метод требует наличия уже обученной few-step базовой модели — это обязательный prerequisite.

Итог

OPSD-V — это не очередная вариация диффузионного сэмплера, а решение конкретной инженерной проблемы: как сохранить качество авторегрессивной видео-генерации на длинных роликах. Cache-aware on-policy self-distillation элегантно обходит фундаментальное противоречие между on-policy обучением (студент генерирует сам) и качеством supervisions (учитель видит реальный контекст).

Для индустрии это означает, что realtime видео-генерация без артефактов деградации — достижимая цель уже сегодня, с существующими моделями и умеренными вычислительными затратами на пост-тренинг. Следующий логический шаг — масштабирование датасета и адаптация метода на более мощные базовые модели следующего поколения.

← Все записи