PROWBench: видеомодели рисуют красиво, но не по программе
Видеомодели уже рисуют игровые сцены так, что их трудно отличить от настоящего движка: Genie, GameNGen и World Labs показывают целые миры прямо из нейросети. Но когда состоянием мира управляет код, а нейросеть только визуализирует его, возникает вопрос, на который до сих пор никто внятно не отвечал: совпадает ли нарисованное с тем, что реально исполнила программа? Свежий препринт PROWBench прогнал через этот тест одиннадцать моделей и показал, что правдоподобная картинка систематически расходится с тем, что исполняет программа.
Что такое программируемые мировые модели
Программируемая мировая модель разделяет мир на две части. Исполняемое состояние и правила живут в коде: агент ведёт учёт объектов, их атрибутов и событий с временными метками. Визуальная генерация живёт в видеомодели, которая получает структурированное описание состояния и рисует наблюдения с выбранной камеры. Такую архитектуру развивают Code World Model и Programmable World Model: логику задаёт обычная программа, которую можно проверить и воспроизвести, а картинку рисует нейросеть.
Но корректное исполнение программы не гарантирует, что видео покажет то же самое. Генерация может выглядеть убедительно и при этом нарушать правила или пропускать предписанные взаимодействия. Проверить, насколько модели верны программе, и взялся PROWBench: 170 процедурно сгенерированных эпизодов, 200 камер и 600 прокси-видео.
Как устроен бенчмарк
Бенчмарк собран из записей исполнения процедурных миров: террейн, здания, дороги, персонажи с постоянными идентификаторами, контроллеры взаимодействий, движения и вождения. Записи хранят состояния сущностей и события с временными метками, в том числе за пределами кадра, поэтому любую сцену можно воспроизвести заново и сравнить сгенерированное видео с тем, что реально произошло в мире.
Каждое состояние рендерится в трёх прокси-представлениях: грубая 3D-геометрия с нейтральными материалами, семантический CWM-прокси с упрощёнными фигурами и цветные ориентированные боксы Colored-OBB с полупрозрачной белой гранью, которая отмечает, куда смотрит сущность. Прокси синхронизированы между видами и представлениями: одну сцену можно показать с разных камер, не меняя сам мир.
Оценка идёт в двух треках. Основной трек состоит из пятисекундных клипов: 40 пар сцен и камер с проверенным первым кадром (Verified-FF) и 90 пар без него (Unverified-FF), где внешность персонажей модель должна вывести сама. Сложный трек проверяет то, что короткими клипами не измерить: десять 30-секундных записей на долгую память и десять сцен с четырьмя синхронизированными видами на согласованность между камерами.
Метрики делятся на три группы. Геометрические проверяют, попадают ли сущности в свои боксы и восстанавливается ли траектория камеры. Поведенческие отвечают на более сложный вопрос, выполнилось ли предписанное действие: Interaction Success Rate требует, чтобы модель-судья на базе Qwen3.6-27B увидела и само действие, и его конечное состояние, а Logic-Render Alignment проверяет, виден ли каждый сегмент таймлайна в своём временном окне. Для памяти измеряют, возвращается ли ушедшая сущность на предписанное место (Reappearance IoU) и сохраняет ли она состояние движения.
Одиннадцать моделей трёх классов
В тесте участвовали одиннадцать моделей. Камера-обусловленные мировые модели (EchoWM, SANA-WM, LingBot-World 2.0, AlayaWorld v1.1) получают первый RGB-кадр, текст и записанную траекторию камеры, но никакой информации о движении сущностей. Прокси-рендереры (Cosmos-Transfer2.5, C2R, CWM, LynnReal-Omni, PWM) переводят движковое представление в фотореалистичное видео: им достаются глубина, сегментация или боксы. Универсальные видеомодели (MiniMax-H3 и Seedance 2.5) получают прокси-видео как референс и под задачу вообще не адаптировались.
Прокси против камеры
Главный результат первого порядка: тот, кто получает прокси, ставит объекты заметно лучше того, кто получает только камеру. Средний BBox IoU прокси-моделей в Verified-FF равен 0,450 и 0,465 против 0,322 у камера-обусловленных, разрыв устойчив в 38 сценах из 40 (медиана +0,14). Лидируют LynnReal-Omni (0,518), MiniMax-H3 (0,494) и CWM (0,454), а камера-модели упираются в диапазон от 0,303 до 0,351. Без проверенного первого кадра расстановка та же: 0,457 и 0,409 у лидеров против 0,204 и 0,255 у остальных.
Дальше начинаются нюансы. Лучший Interaction Success в Verified-FF (0,733) у LingBot-World 2.0, при том что по BBox IoU он третий с конца (0,327): действия он выполняет, но не там, где нужно. Если взвесить успех взаимодействия по точности размещения, LingBot падает на пятое место (gISR 0,241). В лидерах совместного показателя MiniMax-H3 (0,334) и LynnReal-Omni (0,324).
Обратный пример, Cosmos-Transfer2.5: плотная глубина и сегментация дают ему четвёртое место по IoU, но самый низкий Interaction Success и Logic-Render Alignment в обоих сетах. А по камере разрыв между классами почти исчезает: ошибка поворота у большинства методов от 1,7 до 3,4 градуса, что сопоставимо с погрешностью самого оценщика поз (от 1,1 до 2,7 градуса на движковых рендерах). Прокси уже кодирует движение камеры, поэтому отдельная траектория почти ничего не добавляет. Зато важен состав прокси: добавление половины фоновых объектов к боксам снижает ошибку поворота с 6,89 до 3,31 градуса, а метрику CamMC с 0,243 до 0,147.
Красиво не значит верно
Самое интересное начинается там, где нужно связать внешность с конкретным персонажем. Боксовый прокси фиксирует, где кто находится и как двигается, но не то, как кто выглядит: какая одежда кому принадлежит, модель вынуждена угадывать из текста. В сцене с курьером, студентом и туристом MiniMax-H3 по ходу клипа меняет местами наряды студента и туриста, Seedance 2.5 отдаёт одежду курьера студенту и оставляет бокс курьера пустым. В ручном аудите 62 многолюдных сцен MiniMax-H3 перепутал внешность двух людей в 12 случаях.
Та же неопределённость касается ориентации: без изображения, которое фиксирует, как сущность выглядит со стороны камеры, модели иногда разворачивают её задом наперёд. В сцене с лошадью LynnReal-Omni и MiniMax-H3 показывают её круп, а Seedance 2.5 разворачивает мордой к камере. Сущность стоит в своём боксе, но направление не контролируется. Ещё один артефакт, proxy leakage: у универсальных моделей цветные боксы или каркасы из прокси иногда остаются видны прямо в сгенерированном видео.
Длинные горизонты и мультивидовость
Пятисекундные клипы это ещё тепличные условия. На 30-секундных записях BBox IoU падает до 0,175 и 0,28: все методы лучше всего в первые пять секунд (от 0,25 до 0,36), а после десяти секунд скатываются к 0,12 и 0,25. Сорок два результата из пятидесяти остаются ниже 0,3. Хуже всего с возвращающимися сущностями: Reappearance IoU всего от 0,053 до 0,131. Показательный пример: пешеход уходит из кадра на 3,9-й секунде и возвращается на 17,25-й. До ухода его находят все методы (IoU около 0,6), после возвращения CWM даёт 0,34, LynnReal-Omni 0,30, Seedance 2.5 0,17, а MiniMax-H3 0,01. Следить за сущностью внутри локального окна и помнить её после долгого отсутствия это разные навыки.
Мультивидовость добавляет второй пласт проблемы. Четыре вида одной сцены генерируются независимо, так что каждого игрока приходится заново собирать из описания в каждом виде. Геометрия при этом сходится: у C2R лучший MEt3R (0,397), но лишь 32,2% Appearance Compliance и 25,5% Cross-view Consistency: игроки нарисованы одинаково серыми, и судья не может отличить одного от другого. Методы, чьи входы явно различают участников (цветные боксы или первый кадр), достигают от 82 до 94% по Appearance Compliance и от 81 до 90% по Cross-view Consistency. Даже у лучших в 10-19% пар видов персонаж одет иначе.
Доменные события
Есть и хорошая новость для специализации. На 20 сценах перестрелки, где один человек по расписанию получает попадание и падает, доменная модель PWM, обученная только на таких сценах, даёт Interaction Success 0,850 против 0,600 у MiniMax-H3, а общие модели держатся в диапазоне от 0,45 до 0,65. Дообучение под задачу даёт смешанные эффекты: CWM проигрывает своей базе по IoU в 71% пар, а LynnReal-Omni выигрывает в 62% пар и по Logic-Render Alignment в 81% пар без ничьих, но стабильно хуже по warping. Меньший warping сам по себе неоднозначен: он может означать и лучшую временную стабильность, и просто меньше движения.
Что бенчмарк говорит о метриках
Отдельный вывод касается самих метрик. Внутри сцены BBox IoU и Interaction Success почти не связаны: средняя корреляция Спирмена всего 0,05 и 0,06. Качество картинки тем более ничего не говорит: CLIP-Score между методами различается в пределах от 4,5 до 5,6% от среднего, тогда как BBox IoU на 53-79%, а поведенческие метрики на 38-59%. Проще говоря, по CLIP все модели выглядят одинаково хорошими, а по способности исполнять программу различаются в разы. При этом Logic-Render Alignment чувствителен именно к предписанию: если подсунуть судье чужой таймлайн, оценки падают с 0,46-0,85 до 0,07-0,2.
Авторы честно перечисляют ограничения: судья на VLM ещё не откалиброван против человеческих оценок, метрики камеры наследуют ошибку оценщика поз (до 5,4 градуса), набор Unverified-FF собирался с оглядкой на выходы MiniMax-H3, а сложные треки малы, по десять записей каждый.
Что это значит
Общий диагноз: сегодняшние видеомодели уверенно решают задачу правдоподобия и не решают задачу верности исполняемой программе. Прокси-представления оказались рабочим рычагом, они дают контроль над положением и событиями, но не над внешностью и ориентацией. Авторы предлагают строить рендереры поверх сильных видеомоделей и целиться в привязку внешности к сущностям, генерацию с учётом событий, память на длинных горизонтах и согласованность между видами. Для индустрии это значит, что нейросетевые игровые движки появятся не тогда, когда картинка станет красивее, а когда бенчмарки вроде PROWBench перестанут показывать обвал на втором десятке секунд.
Часто задаваемые вопросы
Что такое программируемая мировая модель?
Это архитектура, в которой исполняемое состояние мира и правила взаимодействий живут в коде, а видеомодель только рисует наблюдения с камеры по структурированному описанию. Такой подход отделяет логику от картинки: программу можно проверить и воспроизвести, а рендеринг делегировать нейросети.
Почему обычные метрики видео не годятся для оценки игровых миров?
Качество картинки не связано с верностью программе. В PROWBench CLIP-Score между методами различается всего на 4,5-5,6%, тогда как точность размещения объектов на 53-79%, а поведенческие метрики почти не коррелируют с геометрией (корреляция Спирмена 0,05 и 0,06). Поэтому нужны отдельные проверки исполнения событий и таймлайна.
Могут ли видеомодели заменить игровые движки?
Пока нет. На 30-секундных записях точность размещения падает до 0,175-0,28, возвращающиеся объекты теряются (Reappearance IoU от 0,053 до 0,131), а внешность и ориентация сущностей не контролируются. Прежде чем заменить движки, моделям нужно решить долгую память, привязку идентичности и согласованность между видами.
Итог
PROWBench показывает, что гонка за качеством картинки упирается в потолок: красивое видео ещё не делает мир исполняемым. Бенчмарк даёт измеримую планку для следующих шагов, с реплеями, синхронизированными видами и поведенческими метриками, которые видят разницу между «похоже» и «верно». Следующие игровые миры будут выигрывать не на визуальных демо, а на длинной памяти и честной привязке сущностей. А вы бы поиграли в мир, который целиком рисует нейросеть, или пока надёжнее классический движок с нейросетевым рендером?