MotionForesight: предсказание 3D-движения объектов по обычным видео

MotionForesight: предсказание 3D-движения объектов по обычным видео

Когда вы смотрите, как рука тянется к чашке, вы уже знаете, что произойдёт дальше. Чашка поднимется, наклонится, и из неё польётся кофе. Вам не нужно видеть весь процесс — мозг достраивает будущее на основе прошлого опыта. Именно эту способность — предвидеть физические последствия взаимодействий — исследователи из Stanford и Google DeepMind попытались перенести в искусственные системы. Их работа MotionForesight демонстрирует удивительный результат: модель, обученная всего на 40 тысячах обычных видео, предсказывает трёхмерное движение объектов точнее, чем системы, обученные на миллионах клипов.

Что такое MotionForesight и почему это важно

MotionForesight — это система для предсказания будущей трёхмерной траектории точек на объекте, с которым взаимодействует человек. Если проще: вы показываете модели короткое видео, где рука начинает двигать предмет, и система прогнозирует, куда переместятся точки на этом предмете в следующие секунды. Это не просто предсказание пикселей в кадре — это понимание физической динамики взаимодействия.

Такая способность критически важна для embodied AI — роботов и агентов, которые действуют в реальном мире. Когда робот-манипулятор тянется к объекту, ему недостаточно распознать, что это за объект. Ему нужно предвидеть, как объект поведёт себя при контакте: упадёт ли чашка, если схватить её за край, или откроется ли ящик, если потянуть за ручку. Без понимания будущих последствий действий робот будет совершать ошибки снова и снова.

Ключевая идея: видео уже содержат знания о физике

Исследователи заметили парадокс. Видео-модели, обученные предсказывать следующие кадры, уже содержат богатые знания о том, как объекты движутся при взаимодействии. Когда модель учится генерировать реалистичное видео, она неявно усваивает физику: как падают предметы, как открываются двери, как деформируются мягкие объекты. Но эти знания закодированы в пиксельном пространстве — модель умеет рисовать будущее, но не умеет его измерять в трёхмерных координатах.

MotionForesight решает эту проблему элегантно. Вместо того чтобы обучать модель с нуля предсказывать 3D-траектории, исследователи берут уже обученную видео-модель и переориентируют её с предсказания пикселей на предсказание трёхмерного движения. Они используют трекер, построенный на основе предобученной видео-модели, генерируют псевдо-разметку траекторий на полных клипах, а затем обучают лёгкий адаптер превращать ретроспективное представление трекинга в прогноз будущего. При этом большие компоненты — видео-модель и трекер — остаются замороженными.

Архитектура: от трекинга к предсказанию

Система работает в три этапа. Сначала плотный 3D-трекер отслеживает точки на объекте на протяжении всего видео — и в observed frames (то, что мы видим), и в future frames (то, что произойдёт). Это даёт псевдо-разметку: для каждого момента времени известны трёхмерные координаты точек на объекте.

Затем модель обучается на observed frames только. Она видит короткое видео взаимодействия и учится предсказывать будущие 3D-траектории. Ключевой трюк: вместо того чтобы напрямую предсказывать координаты (что сложно из-за разнообразия объектов и сцен), модель предсказывает изменения в скрытом представлении трекинга. Проще говоря, она учится не «где будет точка», а «как изменится её внутреннее представление в трекинговой системе».

Наконец, лёгкий адаптер превращает эти изменения в конкретные трёхмерные координаты. Адаптер обучается на псевдо-разметке и быстро сходится, потому что ему не нужно учить физику с нуля — вся физика уже закодирована в замороженной видео-модели.

Результаты: 40 тысяч против миллиона

Самое впечатляющее в MotionForesight — это эффективность обучения. Модель обучена всего на 40 тысячах видео взаимодействия человека с объектами. Для сравнения, предыдущие подходы использовали датасеты с сотнями тысяч или даже миллионами клипов с явной 3D-разметкой. При этом MotionForesight не требует никакой дополнительной разметки — ни 3D-моделей объектов, ни координат точек, ни даже информации о том, что это за объект.

На бенчмарках взаимодействия с объектами MotionForesight превзошёл все предыдущие методы. На датасете HOI4D, где измеряется средняя ошибка траектории в миллиметрах, модель показывает 34.2 мм по сравнению с 44.6 мм у лучшего предыдущего метода — снижение на 23%. На датасете FHB, где тестируется предсказание движения рук при манипуляции, ошибка снижается с 39.8 мм до 32.7 мм — улучшение на 18%. На более сложном датасете DexYCB с разнообразными инструментами модель демонстрирует ещё более впечатляющий результат: снижение ошибки с 52.3 мм до 38.1 мм, что составляет 27% улучшения.

Что ещё важнее, модель демонстрирует сильную обобщающую способность. При тестировании на объектах из совершенно новых категорий — когда модель обучалась на кухонной утвари, а тестируется на инструментах или офисных предметах — падение качества составляет менее 15%. Это говорит о том, что модель усвоила не просто шаблоны движений, а более фундаментальные принципы физики взаимодействия. Для сравнения, предыдущие методы при cross-category тестировании теряют 30-40% точности.

Почему это работает: репрезентация важнее данных

Успех MotionForesight подчёркивает важный принцип: качество репрезентации часто важнее количества данных. Предобученные видео-модели уже содержат богатое представление о физике мира, потому что для предсказания следующего кадра нужно неявно понимать, как объекты движутся. Проблема в том, что эти знания закодированы в пространстве пикселей, а не в пространстве 3D-координат.

MotionForesight показывает, что можно эффективно извлечь эти знания и переформатировать их. Вместо того чтобы обучать новую модель с нуля на дорогих 3D-размеченных данных, можно взять готовую видео-модель, добавить лёгкий адаптер и обучить его на псевдо-разметке, сгенерированной автоматически. Это radically снижает стоимость обучения и делает подход масштабируемым.

Применения: от роботов до AR/VR

Способность предсказывать физическое будущее взаимодействий имеет множество применений. В робототехнике это позволяет планировать действия: если робот знает, что чашка упадёт, если схватить её неправильно, он может выбрать более безопасную траекторию. В дополненной реальности — для реалистичного наложения виртуальных объектов, которые должны физически взаимодействовать с реальным миром. В компьютерном зрении — для понимания намерений человека: если мы видим, что рука тянется к объекту определённым образом, мы можем предсказать, что будет дальше, и заранее подготовить систему.

Особенно перспективно использование в imitation learning — обучении роботов по демонстрациям. Если робот может предсказывать последствия своих действий, он может учиться методом проб и ошибок в симуляции, а не в реальном мире. Это ускоряет обучение и снижает риск повреждения оборудования.

Детали обучения и масштабирование

Обучение MotionForesight построено вокруг трёх ключевых компонентов. Базовая видео-модель — это предобученный генератор, замороженный после тренировки на больших видеодатасетах. Трэкер — отдельный модуль, извлекающий 3D-координаты точек из видео. Адаптер — лёгкая нейросеть (примерно 30 миллионов параметров), которая переводит внутренние представления трэкера в прогнозы траекторий. Именно адаптер обучается с нуля, а остальные компоненты остаются фиксированными.

Псевдо-разметка генерируется автоматически. Для каждого обучающего клипа трэкер отслеживает точки на объекте на протяжении всего видео — и в видимых кадрах, и в будущих. Это даёт «ответы» для обучения адаптера без ручного труда. Исследователи показывают, что качество псевдо-разметки критически важно: если трэкер шумит или теряет точки, адаптер обучается хуже. Поэтому перед обучением они применяют фильтрацию — отбрасывают клипы, где трэкер даёт ненадёжные результаты.

Почему это важно для будущего ИИ

MotionForesight представляет более широкий сдвиг в подходе к embodied AI. Традиционно системы, понимающие физику, обучались на симулированных данных или дорогостоящих 3D-разметках. Это создавало разрыв между лабораторными условиями и реальным миром. MotionForesight показывает альтернативный путь: использовать огромные массивы обычных видео, которые уже существуют в интернете, и извлекать из них знания о физике без явной разметки.

Этот подход соответствует когнитивной науке. Люди учатся предсказывать физические последствия действий через наблюдение, а не через формальное обучение. Ребёнок видит, как родитель открывает дверь, и понимает механику задолго до того, как сможет объяснить её словами. MotionForesight следует той же логике: модель учится физике из наблюдений, а не из явных правил.

Ограничения и будущее направление

MotionForesight не лишён ограничений. Модель предсказывает движение точек на объекте, но не моделирует полное физическое взаимодействие. Например, она не учитывает деформацию мягких объектов или разрушение хрупких предметов. Также система предполагает, что объект жёсткий — все точки движутся согласованно. Для мягких или деформируемых объектов потребуются более сложные модели.

Ещё одно ограничение — зависимость от качества трекера. Если трекер теряет точки или ошибается в observed frames, это влияет на качество предсказания. Будущие работы могут улучшить робастность, добавив механизмы коррекции ошибок трекинга.

Тем не менее, MotionForesight открывает новое направление: переиспользование предобученных видео-моделей для задач, требующих понимания физики. Вместо того чтобы обучать специализированные модели с нуля на дорогих размеченных данных, можно извлекать знания из универсальных видео-моделей и адаптировать их для конкретных задач. Это может привести к созданию более эффективных и масштабируемых систем embodied AI.

Часто задаваемые вопросы

Сколько видео нужно для обучения MotionForesight?

Всего 40 тысяч обычных видео взаимодействия человека с объектами. Это на порядки меньше, чем у предыдущих методов, которые использовали сотни тысяч или миллионы клипов с явной 3D-разметкой. При этом MotionForesight не требует никакой дополнительной разметки — ни 3D-моделей, ни координат точек.

Может ли модель предсказывать движение объектов, которых не было в обучении?

Да, MotionForesight демонстрирует сильную обобщающую способность. Модель работает на объектах из новых категорий, в невиданных окружениях и с новых ракурсов. Это говорит о том, что система усвоила фундаментальные принципы физики взаимодействия, а не просто запомнила шаблоны движений.

Как это применимо в робототехнике?

Способность предсказывать физические последствия действий позволяет роботам планировать более эффективно. Если робот знает, что произойдёт при определённом захвате объекта, он может выбрать оптимальную траекторию, избежать падений и повреждений. Это особенно полезно в imitation learning, где робот учится по демонстрациям и может тренироваться в симуляции.

Заключение

MotionForesight показывает, что для понимания физики мира не нужны миллионы размеченных данных — достаточно эффективно использовать знания, уже содержащиеся в предобученных видео-моделях. Переориентация с предсказания пикселей на предсказание трёхмерного движения открывает путь к созданию более эффективных систем embodied AI. Когда роботы смогут предвидеть последствия своих действий так же хорошо, как это делает человеческий мозг, мы увидим новый уровень автономности в реальном мире. Исследователи доказали, что для этого не нужны огромные датасеты — нужна правильная архитектура и понимание того, где искать знания.

← Все записи