HDR: как иерархический диффузионный подход научил видео-модели рассуждать на 76% лучше
Видео-модели научились генерировать впечатляюще реалистичные ролики, но с одной задачей они справляются из рук вон плохо: логически рассуждать. Попросить такую модель провести шарик через лабиринт или переложить диски ханойской башни, и она начнёт совершать ошибки, которые не допустил бы трёхлетний ребёнок. Команда исследователей из проекта Wan предложила решение: фреймворк HDR, который заставил видео-диффузию думать поэтапно, и результат превзошёл ожидания.
Почему видео-модели не умеют думать
Современные генеративные модели видео развиваются в двух направлениях, и каждое из них имеет фундаментальное ограничение. Bidirectional diffusion позволяет модели «передумывать», пересматривать любые кадры на каждом шаге очистки от шума. Это даёт хорошую логическую согласованность, но стоит дорого: на генерацию одного шага требуется 37,92 секунды, потому что модель обрабатывает всю последовательность кадров одновременно.
Стриминговая авторегрессионная диффузия (streaming AR diffusion) работает иначе: кадры генерируются последовательно, слева направо, и каждый следующий зависит от предыдущих. Это быстро: 0,72 секунды на шаг. Но есть проблема: модель не может вернуться назад. Если на третьем кадре она приняла неверное решение (скажем, повела шарик не в тот коридор лабиринта), все последующие кадры унаследуют эту ошибку. Исправить её невозможно: структура не позволяет.
Получается дилемма: либо быстрая генерация без способности к рассуждению, либо рассуждение, но без потоковой передачи и с огромными затратами на вывод. Именно этот разрыв и закрывает HDR.
Идея: рассуждать от грубого к точному
HDR (Hierarchical Denoising for Visual Reasoning) встраивает в процесс генерации видео древовидную иерархию латентных представлений. Вместо того чтобы генерировать кадры сразу на финальном уровне детализации, модель сначала формирует «грубые» гипотезы на верхних уровнях иерархии, а затем постепенно уточняет их на нижних.
Можно провести аналогию с тем, как человек решает лабиринт. Сначала вы смотритее на карту целиком и примерно представляете маршрут: это coarse-level planning. Затем вы фокусируетесь на конкретном повороте, оцениваете тупики и выбираете направление: это промежуточный уровень. И только потом делаете конкретный шаг: это fine-level execution. HDR делает ровно то же самое, но внутри нейросетевой архитектуры.
Конкретно модель организует видео-латенты в дерево из шести уровней. Верхний уровень содержит малое число токенов, каждый из которых кодирует большой фрагмент видео: по сути, «план» на этот сегмент. Каждый следующий уровень удваивает детализацию, разбивая родительский токен на более мелкие. Финальный, шестой уровень: это уже конкретные визуальные состояния, которые декодируются в пиксели.
Во время вывода модель генерирует токены coarse-to-fine: сначала верхний уровень формирует зашумлённые, но пересматриваемые глобальные гипотезы. Когда верхний уровень завершён, следующий уровень берёт его результаты как контекст и уточняет. Процесс продолжается до самого детального уровня, где модель уже не может «передумать», здесь генерация идёт авторегрессивно.
Ключевой момент: на верхних уровнях модель ещё может исправить план. Если на уровне 1 было решено идти налево, а на уровне 2 выяснилось, что там тупик: модель пересматривает решение, потому что верхний уровень всё ещё подвержен denoising-итерациям. Это и есть тот самый механизм «пересматриваемого планирования», которого не хватало стриминговым AR-моделям.
Разрежённое внимание: SHAP
Полноценное внимание (full attention) между всеми токенами на всех уровнях было бы слишком дорого. HDR решает эту проблему через Sparse Hierarchical Attention Pattern (SHAP), структурированную маску внимания, где каждый токен видит лишь ограниченный набор контекста:
- Свой предыдущий токен на том же уровне (авторегрессивная связь)
- Родительский токен на более грубом уровне
- Двух соседей родителя (граничная информация из смежных грубых сегментов)
- Первый кадр как условие задачи
Количество валидных целей внимания для каждого токена: константа, не зависящая от длины видео. Это означает, что вычислительная сложность растёт линейно с длиной, а не квадратично, как в full attention.
SHAP также обеспечивает cross-level KV-cache sharing: как только токен сгенерирован, его ключевые и ценностные векторы записываются в глобальный кеш и используются всеми нижележащими уровнями. Это критично для эффективности: модель не пересчитывает одно и то же дважды.
Архитектура построена на базе Wan2.2-5B-TI2V: пяти-миллиардной видео-модели. HDR использует entropy-matched denoising schedule с шагами [5, 8, 13, 20, 32, 50] на шести уровнях иерархии. Все методы обучались на одинаковом наборе из 18 000 видео,(conditioned) на первом кадре.
Бенчмарк: шесть задач, которые ломают обычные модели
Исследователи создали собственный бенчмарк из шести задач, каждая из которых требует логической согласованности на протяжении множества шагов. Это не просто «сгенерируй красивое видео», здесь каждый кадр должен следовать правилам.
Навигация по лабиринту: красный шарик движется от старта к финишу по решаемому лабиринту. Оценивается, дошёл ли шарик до цели и насколько логичен его путь.
Ханойская башня: перемещение 2–5 дисков между тремя стержнями с соблюдением правила «больший диск не может лежать на меньшем». Есть out-of-distribution случаи, где начальная конфигурация нестандартна.
Рисование одной линией: провести линию через все занятые клетки, не пересекаясь и не возвращаясь. Уровень сложности растёт от 9×9 до 12×12.
Скользящая головоломка: классический 15-puzzle и его варианты. Нужно передвигать плитки к упорядоченному состоянию.
Sokoban: игрок толкает ящик к цели на сетке 8×8 со стенами. Задача кажется простой, но push-механика создаёт экспоненциальное пространство решений.
Переливание воды: цветные блоки в пробирках, нужно переливать между пробирками, чтобы собрать одинаковые цвета вместе.
Для каждой задачи оценивается два показателя: success (точная задача решена) и average progress (средний прогресс, отражающий логическую согласованность промежуточных шагов). Тестовый набор: 370 held-out видео.
Результаты: 76% прирост при той же скорости
Цифры говорят сами за себя. По сравнению с baseline-моделью CausalForcing (стриминговая AR-диффузия):
HDR улучшил overall success с 34,22 до 60,29: это 76,2% относительного прироста. Средний прогресс вырос с 76,00 до 89,56, что означает существенно более согласованные промежуточные рассуждения.
При этом скорость генерации HDR: 0,70 секунды на шаг, практически идентично CausalForcing (0,72s). Bidirectional diffusion при этом требует 37,92 секунды. HDR оказался в 54,2 раза быстрее полно-внимательной модели, при этом превзойдя её по качеству рассуждения.
На отдельных задачах прирост особенно впечатляющий. В навигации по лабиринту success вырос с 52,00 до 85,00. В «переливании воды», с 43,33 до 69,67. В Sokoban: с 63,33 до 78,67. Даже в сложных задачах вроде Tower of Hanoi (где success baseline всего 1,67) HDR достиг 13,00: это семикратный рост, хотя абсолютные числа ещё скромны.
Эффективность данных: 82,9% результата на 2% обучения
Ещё один впечатляющий результат: data efficiency. Когда исследователи сократили обучающую выборку до 2% от полного набора (то есть ~360 видео из 18 000), HDR сохранил 82,9% своего полного performance. Для сравнения, bidirectional diffusion на тех же 2% данных показал лишь 52,0%.
Это означает, что иерархическая структура выступает своеобразным регуляризатором. Грубые уровни иерархии учатся обобщённым паттернам планирования, которые переносятся даже при крайне малом количестве обучающих примеров. Модель не запоминает конкретные траектории: она учится принципу «сначала план, потом детали».
Анализ по уровням иерархии подтверждает эту гипотезу. При одном активном уровне (фактически, это и есть CausalForcing без coarse-to-fine) модель работает на уровне baseline. Добавление второго уровня даёт заметный прирост. К шести уровням прирост становится существенным: каждый дополнительный уровень иерархии добавляет всё больше planning-качества.
Роботы: от синтетики к физическому миру
Самый интересный эксперимент: перенос на реальных роботов. HDR предобучили на 3000 виртуальных видео лабиринтов, затем дообучили всего на 50 реальных видео с роботом-манипулятором. Задача: робот должен взять плюшевую игрушку и провести её через лабиринт из игрушечных блоков.
Здесь вступают факторы, которых нет в синтетике: неточная локализация объектов, окклюзии, вариации освещения, нерегулярные границы лабиринта. Сгенерированные HDR-видео конвертировались в исполняемые действия через inverse dynamics model (IDM).
HDR показал устойчивые success rates на всех уровнях сложности: easy, medium, hard и OOD (where блоки расставлены диагонально или штабелями, создавая нестандартные конфигурации). Это подтверждает, что иерархическое рассуждение переносится за пределы синтетических бенчмарков в физический мир.
На бенчмарке RoboDojo, содержащем 42 роботных задачи в пяти измерениях способностей, HDR-WAM (world-action modeling variant) показал конкурентные результаты без дообучения на роботных данных. Модель, обученная генерировать рассуждающие видео, переносит планировочные способности на embodied control.
Почему это важно
HDR демонстрирует, что рассуждение и эффективность: не взаимоисключающие свойства видео-моделей. Иерархическая структура позволяет совместить лучшее из обоих миров: пересматриваемое планирование bidirectional diffusion и потоковую генерацию AR-диффузии.
Практические импликации широки. Планирование движений роботов, автономная навигация, предсказание физических взаимодействий: всё это задачи, где видео-модель должна не просто генерировать правдоподобные кадры, а следовать логике. HDR показывает, что правильная архитектурная индукция (в данном случае: coarse-to-fine иерархия) может дать модели способность «думать перед тем, как делать» без жертв в скорости.
Особенно перспективен результат data efficiency. Если модель может достичь 83% полного результата на 2% данных: это открывает путь кfew-shot adaptation для задач, где сбор видео-датасетов дорог или невозможен.
Демо проекта доступно на hierarchical-diffusion-reasoning.github.io.
Часто задаваемые вопросы
Чем HDR отличается от chain-of-thought в языковых моделях?
Chain-of-thought разбивает текстовое рассуждение на промежуточные шаги, но работает в дискретном пространстве токенов. HDR делает аналогичное «пошаговое рассуждение» в непрерывном пространстве видео-латентов. Модель формирует всё более детальные визуальные гипотезы на шести уровнях, прежде чем прийти к финальным пикселям.
Можно ли применить HDR к задачам за пределами видео?
Принцип coarse-to-fine hierarchical denoising универсален. Исследователи уже показали перенос на embodied control через RoboDojo (42 задачи). Любая задача, где есть последовательная структура с уровнями абстракции, потенциально выигрывает от иерархического подхода.
Насколько HDR масштабированнее полно-внимательных моделей?
SHAP обеспечивает константное число целей внимания на токен: сложность линейна по длине видео, а не квадратична. При этом HDR превосходит full-attention baseline по качеству рассуждения. Для длинных видео (сотни кадров) это критическое преимущество.
Итог
HDR: не просто улучшение video generation. Это архитектурный паттерн, показывающий, как встроить многошаговое логическое рассуждение в генеративную модель без потери скорости. Рост success на 76% при той же латентности, 54-кратное ускорение относительно bidirectional diffusion, и перенос на реальных роботов с 50 обучающими видео: это конкретные цифры, которые говорят: иерархическое планирование работает.