WorldGuide: видеомодель выполняет задачи, а не рисует видео

WorldGuide: видеомодель выполняет задачи, а не рисует видео

Видеомодели научились рисовать клипы, которые трудно отличить от настоящей съёмки. Но правдоподобная картинка не означает выполненную задачу. Если промпт и длительность зафиксированы до старта генерации, модель не заметит, что перескочила шаг, перепутала порядок действий или продолжает рисовать, когда цель давно достигнута. Для длинных процедур вроде оригами, готовки или сборки мебели это критично: ошибка на одном шаге утаскивает за собой все следующие.

Препринт WorldGuide (arXiv:2610.12459, 8 октября 2026 года) меняет постановку задачи. Генерация процедурного видео превращается в замкнутый цикл выполнения задачи: модель сама решает, какое действие сделать следующим, рисует его последствие и по получившемуся кадру определяет, что делать дальше и когда остановиться.

Что такое WorldGuide

WorldGuide это видеомодель, которая выполняет процедурные задачи шаг за шагом. На входе только стартовый кадр и текстовая цель, например «собери буррито». Дальше работает петля: планировщик выбирает следующее атомарное действие, исполнитель генерирует короткий клип с его результатом, а сгенерированное состояние становится основой для следующего решения. Клипы склеиваются в один финальный ролик.

Когда планировщик понимает, что задача выполнена, он выдаёт токен завершения <|Task Completed|>, и генерация останавливается. Раньше это решение не принимал никто: длительность роллаута выбиралась заранее и не пересматривалась.

Почему открытый цикл не работает

Стандартные видеомодели работают в открытом цикле: промпт и число шагов фиксируются до начала генерации, промежуточный прогресс не проверяется, исправить неудачный шаг нечем. Для короткого клипа это незаметно, для процедуры это провал. Авторы показывают это на примерах: неудачный шаг остаётся в видео, а генерация идёт дальше по инерции.

Петля с обратной связью тоже не гарантирует успех, если собрана из чужих деталей. ORCA, CollabVR и NovaPlan соединяют готового vision-language планировщика с замороженным исполнителем, и правильный план разбивается о то, что исполнитель не умеет реализовать запрошенное действие. SPIRAL оценивает результаты отдельным критиком вместо прямой супервизии исполнения. Bernini планирует в латентном пространстве перед рендерингом, но не выводит следующие действия из сгенерированного прогресса и не определяет завершение.

В качественных сравнениях это видно на конкретных примерах. TempAct складывает тортилью, так и не добавив начинку. PhysAgent вместо буррито начинает штабелировать круглые объекты. Bernini подменяет сцену на совсем другую. У WorldGuide в тех же роликах видны последовательные шаги сборки. Базовые модели с готовым планом справляются с отдельными шагами, но рассыпаются на длинных последовательностях.

Авторы формулируют проблему как зазор между решением выполнить действие и его реальным исполнением. Закрыть зазор можно, только обучая планировщика и исполнителя на одних и тех же пошаговых демонстрациях, чтобы решение каждого опиралось на то, что реально получилось.

Планировщик, исполнитель и петля

ContextPlanner построен на Qwen2.5-VL-7B-Instruct. Он получает цель, текущее визуальное состояние и историю из трёх последних пар «клип плюс действие», после чего предсказывает следующее действие или завершение.

Executor это дообученный HunyuanVideo-1.5 на 8,3 миллиарда параметров. Он получает эмбеддинг действия, текущий кадр и визуальную память, и генерирует клип примерно на две секунды: 48 кадров при 24 fps или 32 кадра при 16 fps. Последний кадр клипа становится опорным изображением для следующего шага, а весь роллаут завершается на токене завершения или по исчерпании бюджета шагов.

Историю поддерживает иерархическая визуальная память в стиле YUME: свежие латентные кадры хранятся в высоком разрешении, старые постепенно сжимаются. Это ограничивает число токенов памяти, поэтому длинные процедуры не взрывают стоимость инференса. В пределе память держит до 1366 латентных кадров, а самый старый кадр сохраняется как якорь.

Одна модель в двух ролях

Есть деталь, которая объясняет компактность системы. HunyuanVideo-1.5 уже использует Qwen2.5-VL-7B для кодирования текстовых промптов, и авторы инициализируют планировщика той же моделью. Одна сеть и предсказывает следующее действие, и кодирует его для исполнителя.

Так исполнитель получает эмбеддинги от модели, на которой он и обучался, в системе нет отдельной планирующей сети, а эмбеддинг действия идёт к исполнителю ровно тем же путём, что и при обучении. Полная система по размеру совпадает с базовым пайплайном HunyuanVideo-1.5.

Языковой интерфейс между модулями даёт ещё три преимущества. Каждый сгенерированный клип сопоставлен понятной текстовой инструкции, поэтому за процедурой легко следить. Ошибки планирования и исполнения разбираются отдельно: предсказанные действия можно заменить эталонными, не трогая исполнителя. А саму последовательность действий можно оценивать как текст, независимо от качества видео.

Обучают модули последовательно. Сначала планировщик: полный файнтюнинг, семь дней на восьми узлах по восемь ускорителей AMD MI210, DeepSpeed ZeRO-3, эффективный батч 1024. Потом планировщик замораживают и обучают исполнителя на эмбеддингах действий от него. Заморозка намеренная: если бы loss исполнителя обновлял планировщик, тот оптимизировался бы под «легко отрендерить», а не под «правильно выбрать действие».

Бенчмарк: 59 тысяч размеченных шагов

Для обучения такого цикла нужны данные, которых раньше не существовало: пошаговые аннотации действий, их визуальные последствия и момент завершения задачи. Существующие наборы покрывают отдельные куски (вопросы-ответы по планированию, локализацию шагов, сегментацию, детекцию ошибок), но супервизии завершения в них нет.

WorldGuide Bench собран из публичных обучающих видео с YouTube длиной до семи минут: 245 задач в 27 процедурных категориях, от оригами и готовки до сборки, ремонта и завязывания узлов. Запросы расширяли короткими и мультиязычными вариантами на 15 языках. Из 133 360 найденных записей автоматический контроль качества на базе Gemini 2.5 Flash пропустил 58 679, то есть 44 процента: остальные отбракованы по полноте демонстрации. Качество аннотаций проверили отдельным человеческим аудитом.

Проверяют модель на 980 отложенных видео из этого набора и на всех 294 примерах Video-CraftBench: сборка из блоков и складывание бумаги.

Результаты: 33,33% против 29,90%

Сравнение выглядит неожиданно. WorldGuide достигает 33,33% Task Success на WorldGuide Bench, а MiniMax-H3 на 33 миллиарда параметров, которая получает готовый план действий как референс, останавливается на 29,90%. На Video-CraftBench разрыв больше: 47,69% против 32,73% при равных условиях, когда всем выдают только стартовый кадр и цель.

Ещё контрастнее сравнение с собственным фундаментом: базовый HunyuanVideo-1.5 с готовыми действиями вытягивает 12,00% успеха, а та же модель внутри петли WorldGuide, без готового плана, добирается до 33,33%.

Как это измеряют: видео оценивает судья на базе Gemini 3.5 Flash, а предсказанные текстовые планы отдельно оценивает GPT-5.2. Task Success бинарный (достигнут ли конечный видимый результат), Plan Accuracy считает достигнутые подцели, Order Score проверяет порядок шагов, Repeat/Skip штрафует лишние повторы и пропуски. У WorldGuide точность плана 62,85, порядок 92,42, лишние повторы 6,06.

Человеческая оценка подтверждает картину: четыре оценщика, девять моделей, 18 задач, 162 видео и 648 оценок. WorldGuide первый со средним баллом 2,75 из 5, дальше MiniMax-H3 (2,54) и LTX-2.5 (2,47). Качество картинки при этом не принесено в жертву: лучшие Aesthetic Quality (49,36) и Overall Consistency (31,13) на основном бенчмарке у WorldGuide, хотя по отдельным метрикам вроде резкости движения его обходят модели, заточенные под визуал, и авторы этого не скрывают.

Что показывают абляции

Абляции здесь интереснее основных цифр, потому что показывают вклад каждого элемента петли.

Вариант без замкнутого цикла, где вся последовательность действий предсказывается один раз до генерации, падает до 11,71% Task Success и 22,87 точности плана. Если убрать у планировщика сгенерированные клипы и оставить только цель с историей действий, результат 14,72%. Знать, что было запрошено, недостаточно: надо видеть, что реально получилось.

Память добавляет 5,77 процентного пункта на WorldGuide Bench и почти 18 пунктов на Video-CraftBench. Оракульный планировщик, которому подставили эталонные действия, поднимает успех до 38,82%, то есть ошибки планирования всё ещё стоят около пяти пунктов. Есть и честная плата: включённая память увеличивает долю повторов (6,06 против 4,39 без неё), потому что сжатие старых кадров иногда выбрасывает детали, нужные позже.

Где всё ещё ломается

Ошибки в замкнутом цикле накапливаются. Планировщик может повторить действие, пропустить предварительный шаг или остановиться слишком рано; исполнитель может исказить геометрию или внешний вид даже при правильной инструкции. Каждый сгенерированный клип становится следующей точкой наблюдения, поэтому перепланирование реагирует на ошибку, но не отменяет испорченный переход.

В примерах со складыванием бумаги видна поздняя деградация картинки: прогресс действий правильный, а форма и текстура листа постепенно уплывают. Авторы перечисляют и системные ограничения: модули обучались последовательно, без общей цели по завершению, а память с фиксированным бюджетом теряет часть деталей.

Направления продолжения понятны: совместная оптимизация планировщика и исполнителя, верификация результатов и явное восстановление после неудачных шагов.

Зачем это нужно

Процедурное видео востребовано там, где важна последовательность, а не отдельный красивый кадр: обучающие ролики, инструкции по сборке, рецепты, симуляции для планирования агентов. Если модель умеет доводить процедуру до конца, генерацию можно использовать как инструмент, а не как аттракцион: черновики инструкций, проверка сценариев, предсказание последствий шагов для агентов и роботов. Сдвиг от открытого синтеза к замкнутому исполнению выглядит практичнее очередной гонки за фотореализмом.

Часто задаваемые вопросы

Что такое закрытый цикл в видеогенерации?

Это схема, где модель проверяет результат каждого шага и корректирует следующие действия по нему. Открытый цикл фиксирует весь план заранее, замкнутый пересчитывает его после каждого сгенерированного фрагмента. WorldGuide замыкает цикл на двух уровнях: планирование следующего действия и решение о завершении задачи.

Чем WorldGuide отличается от обычных видеомоделей?

Обычные видеомодели оптимизируют правдоподобность картинки по промпту. WorldGuide оптимизирует выполнение задачи: предсказывает атомарные действия, генерирует их последствия и сам определяет, когда цель достигнута. Красота кадра здесь следствие, а не цель, и это меняет то, что модель вообще считает успехом.

Это приближает роботов с видеомоделями?

Косвенно. WorldGuide обучен на человеческих видео и не управляет роботом напрямую, но идея замкнутой петли «действие, наблюдение, следующее действие» совпадает с тем, как строятся современные VLA-подходы. Если генерация научится надёжно предсказывать последствия шагов, её можно будет использовать как симулятор для планирования.

Итог

WorldGuide показывает, что видеомодель может быть не генератором красивых клипов, а исполнителем задач: выбирать действия по сгенерированному прогрессу, доводить процедуру до конца и вовремя останавливаться. Замкнутый цикл поднял успех с 11,71% до 33,33%, а система при этом обошла 33-миллиардную MiniMax-H3, которой для сравнения выдали готовый план.

Блог уже разбирал родственные работы: тест «видеомодели завалили экзамен по физике» и бенчмарк PROWBench о расхождении между программой и картинкой. WorldGuide добавляет к этой картине главное, петлю обратной связи, и показывает, что следующий шаг для видеомоделей не в качестве пикселей, а в связке «решение, исполнение, проверка». Препринт доступен на arXiv.

← Все записи