MoSE3: плотное SE(3)-движение для каждого пикселя видео
Роботу, который открывает дверь на петлях, нужны ось вращения и угол поворота. А лучшие современные трекеры движения отдают ему траектории миллиона точек поверхности, в которых эта ось спрятана между строк. MoSE3, новая работа на arXiv, заявляет первый feed-forward-метод, который меняет формат ответа: модель за один прямой проход превращает монокулярное видео в плотное поле SE(3)-трансформаций, по полному 6-DoF-преобразованию в каждом пикселе и в общей мировой системе координат. Поворот, смещение и группировка пикселей по движущимся частям приходят вместе.
До сих пор такой сигнал из обычного RGB-видео казался недостижимым. Восстановление геометрии и движения камеры в динамичных сценах оставалось открытой задачей до недавнего времени, прямая регрессия SE(3) обобщается плохо, а разметки для неё почти нет. Авторы обошли все три препятствия одной идеей: не предсказывать SE(3) напрямую, а собрать её из двух промежуточных сигналов, для которых и данные есть, и обучение проще.
Что такое SE(3) и почему треков недостаточно
SE(3) это группа жёстких преобразований трёхмерного пространства: поворот плюс смещение, шесть степеней свободы. Одно такое преобразование описывает движение твёрдого тела целиком, а пиксели, которые делят общий трансформ, и образуют это тело. Деформируемые объекты превращаются в гладкое поле локально жёстких кусочков.
История оценки движения шла по нарастающей: короткий оптический поток, длинные 2D-треки точек, затем 3D-треки с опорой на геометрические foundation-модели. Каждый шаг расширял горизонт и добавлял пространственную привязку, но представление оставалось низкоуровневым: кривая смещения на пиксель, без вращения и без группировки. Для физического рассуждения и манипуляций этого мало: чтобы повернуть ручку или открыть дверь, роботу нужна не траектория миллиона точек, а ось и угол. Сигнал в трекерах есть, но он погребён на уровне отдельных точек.
Ключевая идея: два простых сигнала вместо одной сложной цели
Прямая регрессия вращений упирается в геометрию: повороты живут на искривлённом многообразии, и евклидова регрессия на нём работает плохо. Вдобавок размеченных SE(3)-данных в открытых корпусах почти нет. Авторы опираются на два наблюдения: 3D-трекеры, обученные только на синтетике, хорошо переносятся на реальные видео, а по плотным трекам и разбиению на жёсткие группы SE(3)-трансформ восстанавливается аналитически, через взвешенное выравнивание по методу Горна.
Отсюда декомпозиция: сеть предсказывает 3D-треки точек и карту эмбеддингов жёсткости. Эмбеддинги нормированы на единичную длину, так что косинусная близость двух пикселей показывает, движутся ли они как одно тело. Дальше внутри каждого мягкого кластера решается взвешенная задача выравнивания, и на выходе получается корректный элемент SE(3) для каждого пикселя. Вся цепочка дифференцируема, поэтому треки, жёсткость и итоговые трансформации обучаются совместно, сквозным градиентом.
Важная деталь: сеть вообще не предсказывает вращения напрямую. Она учит то, для чего есть разметка и что проще выучить, а строгую математику берёт на себя аналитическое восстановление.
Как устроена модель
Архитектурно MoSE3 это надстройка над геометрическим бэкбоном π³ (Pi3), который остаётся замороженным: предобученные геометрические приоры сохраняются, а движение учится поверх. Рядом с замороженной геометрической ветвью работает обучаемая tracking-ветвь, и на каждом слое её токены вниманием смотрят на геометрические токены. Так у треков остаётся постоянная привязка к геометрии: предсказанная точка в кадре должна совпадать с картой точек π³ в том же кадре для видимых областей.
Голов две. Point-tracking-голова выдаёт плотные 3D-треки и логиты видимости по всем кадрам клипа, с чередованием покадрового и глобального self-attention и адаптивной нормализацией под выбранный опорный кадр. Голова эмбеддингов жёсткости работает от тех же признаков, но без привязки к опорному кадру: идентичность жёсткого тела это свойство сцены, а не запроса. На выходе эмбеддинги нормируются, чтобы внутренние произведения измеряли косинусную близость.
Обучение совместное: четыре геометрических лосса на треки (координаты, глубина, поверхностный градиент, временное смещение), бинарная кросс-энтропия на видимость, KL-дивергенция между предсказанным распределением жёстких связей и целевым, посчитанным по ground-truth трансформациям, и прямой лосс на восстановленные SE(3): угловая ошибка поворота плюс штраф на смещение. Аблация показывает, что каждый компонент вносит вклад.
Art-Kubric: датасет, которого не хватало
Вторая половина работы это данные. Авторы собрали Art-Kubric, синтетический корпус, который сочетает шесть вещей, до сих пор не встречавшихся вместе ни в одном публичном датасете: артикулированные объекты из 46 категорий PartNet-Mobility, 226 процедурно собранных категорий Articraft и 7 категорий Infinigen-Articulated, плотные длинные 2D-треки и метрические 3D-треки в мировых координатах, SE(3)-разметку для каждого кинематического звена в каждом кадре, попиксельное разбиение по общему жёсткому движению, физическое взаимодействие нескольких тел и настраиваемый рендер со случайным освещением, интринсиками и композицией.
В релизе 5000 сцен, в каждой от 13 до 30 объектов, около двух третей в движении, камера тоже едет. Суммарно это 163 миллиона треков, и у каждого есть метка жёсткой группы, флаг перекрытия и SE(3)-трансформ его звена в каждом кадре. Формат совместим с загрузчиками Kubric MOVi-F, так что существующие пайплайны трекинга берут датасет без переделок, а открытый пайплайн генерации позволяет рендерить новые клипы с той же разметкой.
Результаты: SE(3) на HO3D и iTACO
Оценка идёт на двух бенчмарках: HO3D, где жёсткие объекты взаимодействуют с руками, и iTACO, где сцены артикулированные и многотельные. Сравнение ведётся по попиксельным трансформациям и на уровне объектов и частей, метрики: угловая ошибка поворота RRE, ошибка смещения ADD, площади под кривыми AUC и IoU кластеров жёсткости.
На HO3D попиксельный разрыв выглядит так: RRE 18,28° у MoSE3 с кластеризацией по обученным эмбеддингам против 33,21° у лучшего baseline (Track4World-Pi3x), ADD 2,16 см против 3,34 см, AUC по повороту 0,569 против 0,371, AUC по смещению 0,785 против 0,669. На артикулированном iTACO преимущество шире: 12,30° против 28,07°, ADD 11,37 см против 20,91 см, AUC по повороту 0,741 против 0,471, AUC по смещению 0,594 против 0,410.
На уровне объектов и частей картина та же. На HO3D MoSE3 даёт IoU 0,709 против 0,414 у лучшего baseline и AUC по смещению 0,802, на iTACO IoU 0,784 против 0,353 и AUC по смещению 0,625. Модель не просто точнее считает трансформы, она ещё и правильнее очерчивает границы движущихся частей: пиксели с общим движением собираются в верные кластеры.
Результаты: 3D-трекинг в мировых координатах
Побочный, но важный эффект: MoSE3 заодно обновляет рекорд в обычном 3D-трекинге. На наборе TAPVid-3D из трёх датасетов (PointOdyssey, ADT, PStudio) он лучший в среднем на обоих горизонтах: 0,5941 на 16 кадрах и 0,5946 на 50 кадрах против 0,5847 и 0,5402 у Track4World. По отдельным датасетам MoSE3 первый везде, кроме ADT на горизонте 16 кадров, где он второй с 0,5789 против 0,6250 у Track4World.
Отдельно отметим устойчивость на длинных горизонтах. У MoSE3 качество на 50 кадрах почти не падает относительно 16: 0,5946 против 0,5941 в среднем, а на ADT даже растёт (0,5953 против 0,5789). У конкурирующих методов спад заметнее: тот же Track4World теряет на длинном горизонте около четырёх с половиной пунктов. Причина в декомпозиции: аналитическое восстановление трансформа по трекам сглаживает накопление ошибки, которое обычно съедает длинные треки.
Аблации: что действительно работает
Самые интересные числа в работе это аблации, прогнанные на iTACO. Полная модель даёт RRE 17,27° и AUC по повороту 0,647. Прямая регрессия SE(3) вместо декомпозиции ухудшает результат до 24,57° и 0,525: тот самый эффект искривлённого пространства поворотов и дефицита разметки. Обучение без Art-Kubric просаживает до 22,89° и 0,566, причём на HO3D с одиночными жёсткими объектами разницы почти нет: датасет важен именно для артикулированных сцен.
Третья группа аблаций показывает, что совместное обучение подтягивает и сами треки. Вариант, где обучаются только треки, а SE(3) восстанавливается постфактум по k-NN-кластеризации, проваливается до 31,11° и 0,453. Вариант, где треки обучались отдельно, а группировка берётся у полной модели, даёт 24,30° и 0,550: даже лучшая постобработка не догоняет совместное обучение. Удаление лосса на жёсткость (18,97° и 0,614) или на SE(3) (23,90° и 0,555) тоже ухудшает результат по сравнению с полной моделью. Все сигналы в связке работают на общий результат.
Ограничения
Слабое место, которое авторы называют честно: зависимость от π³. Позы камеры и интринсики берутся из бэкбона, и ошибки в них напрямую утекают в восстановленные трансформы. Кроме того, поскольку SE(3) собирается из треков и жёсткости, точность падает там, где падают промежуточные сигналы, заметнее всего при быстром движении. Деформируемые сцены показаны только качественно: количественного бенчмарка для них пока нет.
Почему это важно
Задача выглядит узкой, но ставка в ней широкая. Робототехника, манипуляции, физическое рассуждение и понимание артикулированных объектов упираются в один и тот же вопрос: как компактно описать движение сцены. Траектории точек это сырьё, из которого каждому потребителю приходится самому выковыривать структуру. Плотное поле SE(3) отдаёт структуру сразу: поворот, смещение и разбиение на части в одном представлении, причём из обычного RGB-видео, без лидаров и мультикамерных ригов.
Контекст добавляет перспективу. Геометрические foundation-модели вроде π³ и VGGT научились за один проход вытаскивать из кадров геометрию сцены. Следующий слой над этим это движение, и MoSE3 показывает, как он может выглядеть: замороженная геометрия плюс лёгкая обучаемая надстройка, которая превращает треки в физически осмысленные трансформации. Тот факт, что метод попутно обновил рекорд в трекинге, намекает, что структура помогает даже базовой задаче.
Часто задаваемые вопросы
Что такое SE(3) простыми словами?
Это математическое описание жёсткого движения: поворот плюс смещение, шесть степеней свободы. Один SE(3)-трансформ описывает движение твёрдого тела целиком, без разложения на отдельные точки. Если два пикселя делят один трансформ, они принадлежат одной движущейся части сцены.
Почему SE(3) нельзя просто предсказать нейросетью?
Предсказать можно, но обобщается такая регрессия плохо: повороты живут на искривлённом многообразии, неудобном для евклидовых методов, а размеченных SE(3)-данных мало. Аблация в статье подтверждает: прямая регрессия даёт RRE 24,57° против 17,27° у декомпозиции через треки и жёсткость.
Зачем нужен датасет Art-Kubric?
Ни один публичный корпус не давал сразу SE(3)-разметку для каждого звена, плотные треки и физику взаимодействия нескольких тел. Art-Kubric закрывает этот пробел: 5000 сцен и 163 миллиона размеченных треков. Без него модель теряет точность на артикулированных сценах: RRE растёт с 17,27° до 22,89°.
Где это можно применить?
Везде, где робот или агент должен понять движение сцены: манипуляции с дверями, ящиками и инструментами, физическое рассуждение, обучение с подкреплением в симуляторах. Вместо траекторий отдельных точек потребитель сразу получает оси, углы и разбиение на части, а это готовые входы для планирования.
Итог
MoSE3 это пример смены стратегии: вместо того чтобы учить сеть предсказывать сложный математический объект напрямую, авторы разложили его на два простых сигнала и вернули строгую форму аналитически. Результат: первый feed-forward-метод плотного SE(3)-движения из монокулярного видео, SOTA на HO3D и iTACO, попутный рекорд в 3D-трекинге и открытый датасет Art-Kubric на 163 миллиона треков.
Если вы работаете с 3D-зрением или робототехникой, следующий шаг простой: открыть статью на arXiv и прикинуть, как плотное поле SE(3) ложится на вашу задачу. Представление, которое отдаёт оси и углы вместо облака точек, может сэкономить не один слой самодельной постобработки.