4DAnyone: 4D-аватар из обычного видео без студии

4DAnyone: 4D-аватар из обычного видео без студии

Чтобы превратить человека в объёмную движущуюся 3D-модель, которую можно крутить с любого ракурса, индустрия до сих пор использует студии захвата: десятки синхронизированных камер, калибровка, контролируемый свет. Команда из Чжэцзянского университета и Ant Group в работе 4DAnyone (arXiv 2608.20335) убрала студию из уравнения. Их метод берёт обычное монокулярное видео, снятое непонятно какой камерой и непонятно откуда, и восстанавливает из него полноценную 4D-модель человека. По ключевой метрике качества реконструкции они обогнали сильнейшего конкурента на 3.6 dB PSNR, а это разрыв, который в задачах рендеринга виден невооружённым глазом.

Что такое 4D-реконструкция человека

4D-реконструкция это построение объёмной модели сцены, которая меняется во времени: три пространственных измерения плюс движение. Современный стандарт представления называется 4D Gaussian Splatting (4DGS): сцена хранится как облако гауссовых примитивов с позициями, цветами и деформациями, что даёт фотореалистичный рендеринг в реальном времени с любого ракурса. Проблема в том, что обучить 4DGS можно только на плотном мультикамерном видео с известными параметрами камер. Одного ролика с телефона для этого мало: половина тела в каждый момент времени просто не видна.

Почему очевидное решение не работает

Напрашивающийся пайплайн выглядит так: возьмём camera-controlled видеодиффузионную модель, сгенерируем недостающие ракурсы и скормим их в 4DGS. Методы вроде ReCamMaster или CAT4D действительно умеют перерендеривать видео с новой траекторией камеры. Но когда нужно не два-три ракурса, а десятки, необходимые для реконструкции, они ломаются: внешность человека плывёт от вида к виду, геометрия дрейфует, и собранная из такого материала 4D-модель разваливается. Авторы формулируют это точно: узкое место не управление камерой само по себе, а поддержание межвидовой согласованности на масштабе реконструкции.

Механика поломки понятна, если посмотреть на архитектуру конкурентов. Неявные методы вроде CameraCtrl или MotionCtrl кодируют камеру через обученные представления без жёстких геометрических ограничений, и при больших сменах ракурса эта «мягкая» привязка просто плывёт. Явные методы вроде Gen3C или TrajectoryCrafter опираются на плотную метрическую глубину и облака точек, которые из любительского видео оцениваются ненадёжно: стоит оценке глубины ошибиться на движущемся человеке, и ошибка протаскивается во все синтезированные виды. Результат виден в цифрах: TrajectoryCrafter на DNA-Rendering выдаёт всего 13.56 dB PSNR, что соответствует практически неузнаваемой картинке.

Как устроен 4DAnyone

Система построена вокруг трёх идей. Первая: скелет как геометрический компас. Модель восстановления позы GVHMR извлекает из исходного видео последовательность 3D-скелетов SMPL-X, из которых регрессор достаёт 70 ключевых точек словаря Goliath. Эти скелеты рендерятся в depth-buffered видео для каждого целевого ракурса и подаются в диффузионный трансформер как условие. Скелет разрежен и груб, но именно поэтому он надёжен там, где глубина и облака точек из любительского видео врут. Отдельная деталь: собственный регрессор точек даёт среднюю ошибку 3.5 мм против 14.0 мм у наивного baseline с ближайшей вершиной.

Вторая идея, Reference Context Packing (RCP), решает проблему внешности. Исходный кадр упаковывается в компактные референс-токены через мультимасштабный patchify: слои с ядром 4×4 и 8×8 выдают в 4 и в 16 раз меньше токенов, чем стандартный. Так модель получает «паспорт внешности» человека, не раздувая контекст до неподъёмного размера.

Третья идея, Target Context Routing (TCR), борется с дрейфом между группами ракурсов. Генерировать от 16 до 48 видео за один проход невозможно, поэтому ракурсы обрабатываются группами, а TCR прокидывает информацию между ними, в том числе позволяя параллельный denoising на нескольких GPU. Дополнительно уже сгенерированные виды упаковываются обратно в RCP-контекст и служат референсами для следующих раундов, и multiview self-attention, инициализированный из темпорального внимания базовой Wan2.2, даёт токенам разных ракурсов напрямую attend друг к другу.

Данные и обучение

Базой послужила Wan2.2-TI2V-5B, которую дообучали на разрешении 704×1280 в три стадии суммарной длительностью около трёх дней на 128 GPU H20-3E. Датасеты собрали пёстрые: MVGameHuman с 38 тысячами синтетических мультикамерных роликов на 318 актёров и 24 виртуальных камер, отрендеренных на собственном игровом движке, SynCamVideo с 34 тысячами роликов, DNA-Rendering с 51 тысячей реальных записей с 48 камер, плюс монокулярные TedTalk и Pexels для обобщения на «дикие» видео. Любопытная деталь: LPIPS-лосс считали не по целому кадру, а по body-part-aware кропам, с вероятностями 0.2 для лица, по 0.1 для каждой кисти, 0.2 для тела и 0.4 равномерно, потому что лицо и руки зрительно важнее фона.

Цифры

На DNA-Rendering согласованность сгенерированных видео у 4DAnyone составила 24.33 dB PSNR при LPIPS 0.163 против 21.47 dB и 0.210 у дообученного ReCamMaster и 21.25 у MV-Performer. На DyMVHumans разрыв ещё заметнее: 24.48 против 21.94. Но главный тест это даунстрим-реконструкция: 4DGS, обученный на видео 4DAnyone, достигает 24.15 dB PSNR на DNA-Rendering против 20.55 у лучшего конкурента, и 23.28 против 19.86 на DyMVHumans. Почти четыре децибела на реконструкции это разница между «похоже» и «не отличить».

Абляция показывает, что оба механизма работают. Без TCR и RCP модель выдаёт 21.09 dB, возврат RCP поднимает до 22.03, возврат TCR до 22.21, полная конфигурация со sliding-стратегией даёт 22.63. Отдельно замерили, сколько sliding-шагов нужно: прирост затухает примерно после 16 шагов, дальше десятые доли децибела.

Стоит сказать пару слов о самих метриках, потому что без них таблица читается как набор чисел. PSNR измеряет попиксельную близость к эталонному кадру в децибелах: в задачах novel view synthesis диапазон 20-25 dB это рабочая зона, где каждый дополнительный децибел заметен глазу, а разрыв в 3-4 dB отделяет «приятно смотреть» от «больно смотреть». SSIM ловит структурное сходство, контрасты и текстуры, и здесь 4DAnyone держит 0.862 против 0.806 у ближайшего конкурента. LPIPS самая жёсткая из трёх: она измеряет перцептуальное расстояние через признаки нейросети, и падение с 0.210 до 0.163 означает, что люди в слепом тесте будут реже отличать синтез от реальной записи.

От одной фотографии до аватара

В приложении авторы собирают конвейер полного цикла: берёте один портрет, прогоняете через Wan-Animate, который оживляет его по движениям из референсного видео, полученный монокулярный ролик скармливаете в 4DAnyone, и на выходе FreeTimeGS строит анимируемого 4D-аватара. Для инференса достаточно 4-8 GPU: конфигурация с 16 камерами покрывает free-viewpoint рендеринг на ограниченных углах, 32 камеры закрывают большинство сценариев, а 48 нужны для сложной одежды и экстремальных движений.

Сама 4DGS-реконструкция тоже довольно практичная: FreeTimeGS оптимизируют Adam с learning rate 1.6e-4 в течение 50 тысяч итераций на последовательностях из 16 камер и 121 кадра, а гауссовы примитивы инициализируют грубой геометрией из space carving по предсказанным маскам переднего плана. Это не интерактивная игрушка на ноутбуке, но и не проект на месяц: при наличии небольшого GPU-сервера весь путь от ролика до вращаемого аватара укладывается в часы.

Где это пригодится

Список приложений авторы называют вскользь: embodied AI, иммерсивный контент, виртуальная реальность. Если развернуть, то самые очевидные сценарии это игровые и VR-ассеты (вместо ручного моделирования персонажа записываете актёра на телефон), volumetric-видео для телеприсутствия и виртуальных митингов, цифровые двойники для спорта и хореографии, где тренеру важно рассмотреть движение со всех сторон, и обучающие данные для роботов, которым нужно видеть, как человек выполняет действие, со всех ракурсов сразу. Везде, где раньше требовалась студия с 48 камерами, теперь достаточно одной записи и вечера вычислений.

Где метод ломается

Честный раздел с failure cases называет два режима отказа. Первый: свободная одежда. Скелет ничего не говорит о ткани, которая движется далеко от тела, поэтому широкие развевающиеся одежды генерируются несогласованно между видами и портят реконструкцию. Второй: ошибки оценки позы. В примере с балериной, стоящей на пуантах, HMR решил, что стопы плоские, и все сгенерированные ракурсы добросовестно унаследовали эту ошибку. Мусор на входе, согласованный мусор на выходе.

Дипфейковый слон в комнате

Авторы прямо пишут: метод синтезирует реалистичные видео людей, а значит создаёт риски misuse, от дипфейков до нарушения приватности и авторских прав. Их позиция стандартная для таких работ: результаты должны помечаться как синтетические и создаваться только с согласия изображённого человека. На практике, конечно, технология такого уровня делает «снял на телефон, получил объёмного двойника» вопросом ближайших лет, и регуляторная рамка явно поспевает последней.

Часто задаваемые вопросы

Чем 4DAnyone отличается от NeRF-реконструкции по одному видео?

Монокулярные методы обычно требуют известных параметров камеры и плохо справляются с окклюзиями: невидимые части тела приходится выдумывать без контроля согласованности. 4DAnyone не реконструирует напрямую, а генерирует десятки согласованных ракурсов диффузионной моделью и только потом строит 4DGS, поэтому качество внешности и геометрии заметно выше.

Сколько железа нужно для инференса?

По таблице авторов, минимальная рабочая конфигурация это 4 GPU на 16 целевых камер, типичная: 8 GPU на 32 камеры. Обучение, правда, история другого масштаба: три дня на 128 ускорителях H20-3E.

Почему скелет, а не глубина или облака точек?

Плотная метрическая глубина из любительского видео оценивается ненадёжно, особенно для движущегося человека и больших смен ракурса. Скелет разрежен, но робастен: даже при окклюзиях и смазе HMR выдаёт правдоподобную позу, а z-buffer по относительной глубине точек инвариантен к абсолютному масштабу сцены.

Сколько видео нужно сгенерировать для хорошей реконструкции?

По таблице инференс-конфигураций, минимум это 16 целевых ракурсов плюс исходное видео. Такой набор закрывает свободный облёт на ограниченных углах по вертикали. Для сложной одежды или экстремальных движений авторы рекомендуют 48 камер в три слоя генерации. Больше ракурсов значит плотнее покрытие, но и дольше пайплайн.

Можно ли применить это к объектам, а не к людям?

Напрямую нет: весь конвейер завязан на человеческий скелет, SMPL-X-меши и HMR-модель, обученную на людях. Для произвольных объектов понадобился бы аналогичный разреженный геометрический prior, а вот идеи RCP и TCR переносимы и, судя по абляции, дают прирост независимо от домена.

Итог

4DAnyone показывает, что барьер «нужна студия захвата» для 4D-аватаров пал: скелетное кондиционирование плюс два механизма согласованности, RCP и TCR, превращают диффузионную видеомодель в фабрику реконструкционно-чистых ракурсов. Результат: +3.6-3.8 dB PSNR на даунстрим-реконструкции против сильнейших baseline и рабочий конвейер от одной фотографии до анимируемого 4D-двойника. Если работаете с виртуальными аватарами, игровыми ассетами или volumetric-контентом, самое время смотреть на FreeTimeGS и скелетное кондиционирование: именно эта связка, судя по цифрам, станет стандартным рецептом монокулярной 4D-реконструкции.

← Все записи