WorldSculpt: генерация 3D-сцен из видео с сотнями объектов

WorldSculpt: генерация 3D-сцен из видео с сотнями объектов

Рабочий стол, заваленный сотнями мелких предметов. Чашки перекрывают книги, книги закрывают кабели, а половину вещей вообще не видно ни с одной точки съёмки. Теперь попробуйте восстановить полную 3D-геометрию каждого предмета по видео, где камера просто облетела стол по кругу. Именно эту задачу решает WorldSculpt, и решает способом, который ещё недавно казался нереалистичным: модель обучалась исключительно на одиночных объектах, но на инференсе справляется со сценами, где сотни вещей взаимно загораживают друг друга.

Что такое WorldSculpt

WorldSculpt: это метод генерации композиционного 3D-представления захламлённой сцены из набора видеокадров с известными параметрами камеры, инстанс-масками и грубыми 3D-боксами объектов. Сцена восстанавливается не единым монолитным мешем, а коллекцией отдельных объектов, каждый со своей геометрией и трансформацией в общую мировую систему координат. Такой формат напрямую подходит для игровых движков, AR/VR, симуляций и робототехники, где объекты нужно двигать, удалять и редактировать по одному.

Почему монолитная реконструкция проигрывает

Классические геометрические подходы, от многовидового стерео до 3D Gaussian Splatting, восстанавливают сцену как единое целое. Там, где объект закрыт соседями, геометрия просто отсутствует: дырки, размытые поверхности, недостроенные задние стороны. Для рендера с исходных ракурсов это терпимо. Для редактирования, физической симуляции и переноса объектов между сценами, нет.

Композиционные методы с генеративными приорами пошли другим путём: невидимое не восстанавливать из наблюдений, а достраивать обученной моделью. Проблема в том, что до сих пор такие подходы справлялись лишь с простыми сценами. Стол с десятком предметов и умеренными перекрытиями, это их потолок. WorldSculpt сдвигает планку почти на два порядка: в экспериментах фигурируют сцены с 93–701 объектом и тяжёлой взаимной окклюзией.

Как устроен метод

Конвейер состоит из трёх стадий, и ключевая идея всех трёх одна: свести сложную сцену к множеству независимых задач генерации одиночных объектов, не теряя при этом информацию из разных ракурсов.

Первая стадия, якорная каноникализация. Генеративная модель объектов приучена работать в нормализованном кубе и с каноническим фронтальным ракурсом, а грубый бокс локализации из детектора этим требованиям не удовлетворяет: стороны неравны, ориентация случайна. Для каждого объекта WorldSculpt строит виртуальный канонический куб, ориентированный по якорному виду, тому кадру, где объект виден наиболее полно. Если бокс оказался тесным, куб равномерно расширяется, пока его проекция не покроет маски объекта во всех выбранных кадрах. Каждое наблюдение затем кропается по проекции куба, фон вырезается маской, а интринсики камеры пересчитываются под новую систему координат кропа. Эта crop-aware проекция позволяет точно отобразить любой воксель канонического объёма в пиксель конкретного кадра, не предполагая, что объект находится в центре изображения.

Вторая стадия, подъём мультивидовых признаков. Каждый кроп независимо кодируется DINOv3, после чего 2D-признаки проецируются в общий канонический воксельный объём. Один и тот же участок объекта, видимый с разных ракурсов, собирает признаки из всех кадров. Возникает вопрос агрегации: как слить разнородные наблюдения. Простое усреднение работает, пока ракурсы примерно равноценны. В захламлённых сценах это не так, и WorldSculpt использует обучаемый агрегатор в духе image-based rendering, который назначает каждому вокселю взвешенный, зависящий от вида вклад. Агрегатор инвариантен к перестановке кадров и инициализируется нулевым остаточным слоем, то есть на старте обучения в точности эквивалентен среднему, а дальше сам учится, каким наблюдениям доверять больше.

Третья стадия, собственно генерация. За неё отвечает Pixal3D, нативная 3D-модель на бэкбоне TRELLIS.2, генерирующая объект каскадом flow-matching стадий. Используются первые две: стадия разреженной структуры предсказывает грубую занятость на сетке 64³, стадия формы генерирует высокоразрешенный структурированный латент по занятым вокселям, который декодируется в меш. Текстурная стадия оставлена на будущую работу. Собранное 3D-условие из воксельных признаков подаётся в обе геометрические стадии через zero-initialized инжекционные слои и LoRA-адаптацию, а глобальные токены якорного вида дополнительно направляют генерацию. Готовый меш переносится в мир своей каноникал-мире трансформацией.

Выбор техники адаптации здесь не случаен. Zero-initialized слои гарантируют, что на старте дообучения новое условие никак не влияет на выход: модель ведёт себя как исходный Pixal3D и не теряет накопленный объектный приор, пока инжекционные веса постепенно отходят от нуля. LoRA со своей стороны ограничивает число обучаемых параметров, что снижает риск катастрофического забывания на узком домене одиночных объектов. По сути, авторы покупают мультивидовую обвязку, не расплачиваясь за неё качеством базового генератора. Косвенное подтверждение видно и в числах: в одновидовом режиме адаптированная модель не уступает специализированному single-view пайплайну, хотя никогда не оптимизировалась под одиночное изображение.

Главный трюк: ноль сцен в обучении

Самое неочевидное свойство системы: она ни разу не видела сцену при обучении. Модель дообучалась только на одиночных объектах в каноническом пространстве. Никаких размеченных композиций, никакого scene-level датасета. Тем не менее на инференсе она обрабатывает сцены с сотнями объектов, потому что каждый объект решается как независимая задача в собственном каноническом кубе, а мультивидовое условие компенсирует то, что не удалось увидеть.

Это снимает главное узкое место композиционных методов. Данные на уровне сцен с попиксельными масками и ground-truth мешами дороги и редки, а одиночных объектов с рендерами много. Парадигма «обучайся на простом, обобщайся на сложное» здесь работает буквально.

Есть и второй, менее заметный инженерный ход, который делает обобщение возможным. При обучении число входных видов варьируется, а якорный кадр выбирается случайно, поэтому модель не привязывается ни к конкретному числу ракурсов, ни к их конфигурации. На инференсе якорь выбирается как вид с наиболее полной видимостью объекта, и та же самая сеть одинаково принимает и одиночный кадр, и шестнадцать. Это превращает систему в практичный инструмент: сколько наблюдений удалось собрать, столько и используем, без переобучения под каждый режим.

UE-MeshyScene: бенчмарк на вырост

Существующие бенчмарки не тянули на такую сложность: HouseCat6D содержит разреженные столешницы с мягкой окклюзией, Toys4k-Scene плотнее, но объектов всё равно немного. Поэтому авторы собрали UE-MeshyScene: шесть фотореалистичных окружений, отрендеренных в Unreal Engine 5.8 при 2560×1440, от относительно аккуратных до экстремально захламлённых. В каждой сцене от 93 до 701 объекта, камера движется по орбитальной траектории, а ground truth включает точные попиксельные меши и аннотации каждого предмета. Это первый бенчмарк, где композиционную генерацию можно честно мерить на сценах реальной плотности.

Результаты: чем больше хаос, тем больше отрыв

Оценка шла по нарастающей сложности. На канонической генерации одиночных объектов (Toys4k, от 1 до 16 видов, окклюзия до 75% на кадр) WorldSculpt на одном виде конкурентоспособен со специализированным single-view Pixal3D, а с добавлением ракурсов уходит вперёд. Показательна устойчивость: с 16 видами качество почти не меняется вплоть до 50% окклюзии на кадр, тогда как одновидовые бейзлайны деградируют заметно.

На сценовых бенчмарках метод обходит SAM3D и мультивидовый ShapeR по всем метрикам: Chamfer Distance, EMD и F-Score. Отрыв растёт вместе со сложностью сцены и особенно заметен в медиане по инстансам, то есть выигрыш не объясняется горсткой простых объектов, а держится на типичных предметах сцены.

Абляция фьюжна подтверждает ценность обучаемой агрегации именно в тяжёлом режиме. С двумя видами и 75% окклюзией IBR-агрегатор снижает CD-ℓ2 с 12.91 до 10.03 и поднимает F@0.05 с 0.742 до 0.762. На UE-MeshyScene он уменьшает CD-ℓ2 на 12% и поднимает F-Score с 0.944 до 0.951 по сравнению с усреднением. Логика прозрачна: чем разношёрстнее наблюдения, тем важнее уметь решать, каким из них верить.

Из Gaussian Splatting в редактируемые меши

Отдельно авторы показали прикладной сценарий, который выглядит почти как замкнутый круг генеративного 3D. Они берут миры, сгенерированные в формате 3D Gaussian Splatting системами Marble и HY-World 2.0, рендерят по ним позированные наблюдения и прогоняют через WorldSculpt. На выходе сплат-сцена превращается в набор отдельных мешей в общей системе координат. Иначе говоря, генеративный мир, который раньше можно было только осматривать, становится редактируемым ассетом: объекты можно двигать, заменять, экспортировать в движок.

Почему это важно

Индустрия генеративного 3D быстро движется к world models, которые синтезируют целые окружения. Но пока результат такой генерации остаётся монолитным сплатом или видео, ценность его ограничена просмотром. Реальные пайплайны, игры, симуляция для роботов, AR, нуждаются в разобранной сцене, где каждый объект адресуем. WorldSculpt показывает практичный мост между двумя мирами: сильный объектный генеративный приор плюс аккуратная мультивидовая обвязка дают композиционные сцены без единого обучающего примера на уровне сцены. Следующие шаги авторы видят в генерации текстур и материалов и в отказе от допущения статичности, то есть в поддержке движущихся и деформируемых объектов.

Часто задаваемые вопросы

Что WorldSculpt требует на вход?

Позированные кадры с известными интринсиками и экстринсиками камеры, инстанс-маски объектов в кадрах и грубые 3D-боксы локализации. Получение этих входов, отдельная хорошо изученная задача (детекция, трекинг, сегментация), и в работе она сознательно вынесена за скобки.

Нужно ли обучать модель на сценах?

Нет. Модель дообучается только на одиночных объектах в каноническом пространстве, но обобщается на сцены с сотнями объектов за счёт покадровой декомпозиции и мультивидового условия. Scene-level данные для обучения не требуются вовсе.

Чем это лучше 3D Gaussian Splatting?

Это разные представления. Сплаттинг даёт быстрый фотореалистичный рендер сцены как единого целого, но без отдельных объектов и с дырами в окклюдированных областях. WorldSculpt выдаёт набор индивидуальных мешей, пригодных для редактирования и симуляции, и умеет конвертировать сплат-сцены в такой формат.

Каковы главные ограничения?

Генерируется только геометрия, без текстур и материалов. Сцена предполагается статичной, а входные маски и боксы корректными: ошибки локализации напрямую портят результат. Наконец, качество невидимых областей ограничено тем, что умеет достраивать объектный приор.

Итог

WorldSculpt переводит композиционную генерацию 3D из режима «стол с десятком предметов» в режим «архивная полка с семью сотнями». Рецепт прост в изложении и нетривиален в исполнении: канонизировать каждый объект по якорному виду, поднять DINOv3-признаки всех ракурсов в общий воксельный объём, слить их обучаемым агрегатором и прогнать через адаптированный Pixal3D. Если ваш пайплайн упирается в превращение сгенерированных или отсканированных сцен в редактируемые ассеты, эта работа задаёт новый ориентир: статья и бенчмарк UE-MeshyScene уже доступны на ArXiv, и за ними стоит следить всем, кто строит world models для практических применений.

← Все записи