Видео-модели как мозги роботов: как pixel-masking заменяет физику

Видео-модели как мозги роботов: как pixel-masking заменяет физику

Когда вы управляете роботом-манипулятором, вам нужно знать физику: как он движется, что произойдёт, если он схватит предмет, как изменится сцена после действия. Традиционный подход — строить явные модели: inverse kinematics, physics engines, trajectory planners. Это работает, но требует месяцев настройки для каждого нового робота и каждой новой задачи.

Исследование Masked Visual Actions (arXiv, июль 2026) предлагает радикально иной путь. Вместо того чтобы учить робота физике через уравнения, они берут предобученную видео-модель — ту, что умеет генерировать реалистичные видеоролики — и заставляют её решать задачи управления через простой трюк: маскирование пикселей. Робот не "понимает" физику в явном виде. Он просто смотрит на видео, видит замаскированные области и учится предсказывать, как они должны выглядеть через несколько кадров. Оказывается, этого достаточно, чтобы управлять реальным манипулятором Franka Panda с точностью, сравнимой с традиционными методами — но без единой строчки кода физики.

Почему видео-модели — это не просто генераторы картинок

Видео-генераторы вроде Sora, Veo или Genie обучаются на миллионах часов реальных видео. Они видят, как падают предметы, как люди ходят, как автомобили поворачивают, как жидкости разливаются. В процессе обучения они неявно усваивают физику мира — не через уравнения, а через статистику визуальных паттернов.

Ключевая идея Masked Visual Actions: если видео-модель уже "знает" физику (пусть и в скрытой форме), её можно использовать как world model — симулятор, который предсказывает будущее на основе текущего состояния и действия. Но как сообщить модели, какое действие выполняется? Традиционные методы требуют явного представления: joint angles, end-effector poses, velocity vectors. Проблема в том, что видео-модель обучалась на пикселях, а не на векторах. Между этими представлениями — пропасть.

Авторы предлагают решение: действие = маска. Вместо того чтобы говорить модели "рука движется со скоростью X", вы показываете ей траекторию руки в пиксельном пространстве, но маскируете остальные части сцены. Модель видит: "Вот здесь была рука, вот здесь она будет через N кадров, а эти объекты остаются неизменными". Задача модели — сгенерировать реалистичное видео, где рука движется по указанной траектории, а остальная сцена эволюционирует в соответствии с выученной физикой.

Это элегантно по двум причинам. Во-первых, действие представлено в том же пространстве (пиксели), в котором работает модель — не нужно учить её понимать вектора. Во-вторых, маска одновременно специфицирует действие и предоставляет контекст: модель видит не только "что делать", но и "где делать это" — какие объекты задействованы, какие препятствия учесть, как должна измениться сцена.

Как это работает на практике

Архитектура состоит из трёх компонентов. Первый — предобученная видео-модель (в статье используется версия на основе CogVideoX, обученная на 30 миллионах видео). Она умеет генерировать реалистичные 5-секундные клипы, но не знает ничего о робототехнике.

Второй компонент — механизм маскирования. Когда робот выполняет действие (например, тянется к чашке), система создаёт маску: белые пиксели там, где будет рука робота и чашка, чёрные — везде остальном. Эта маска подаётся модели как условие: "Сгенерируй видео, где эти белые области движутся вот так, а остальное остаётся правдоподобным".

Третий компонент — применение. Видео-модель можно использовать двумя способами. Как forward model: вы предлагаете несколько возможных траекторий руки, модель генерирует видео для каждой, и вы выбираете ту, где чашка оказалась в нужном месте. Как inverse model: вы указываете желаемый результат (чашка должна быть здесь), и модель синтезирует видео, показывающее, как рука должна двигаться, чтобы этого достичь. Из этого видео извлекается траектория, которая подаётся на низкий уровень управления.

Эксперименты проводились на трёх датасетах: BEHAVIOR-1K (симуляция двуруких гуманоидных роботов), DROID (реальные манипуляторы Franka с телеоперацией), и собственные сборы авторов с Franka Panda в лабораторных условиях. Во всех трёх случаях Masked Visual Actions превзошли или сравнялись с базовыми методами, включая ControlNet-адаптации видео-моделей и явные physics-based planners.

Особенно впечатляет результат на unseen embodiments — роботах, которых модель не видела во время обучения. Когда модель обучалась на манипуляторах с одной рукой, а тестировалась на двуруких гуманоидах, она сохраняла работоспособность. Это прямое следствие подхода: видео-модель не привязана к конкретному кинематическому дереву, она работает с пикселями. Если вы покажете ей маску в форме новой руки, она попытается сгенерировать правдоподобное движение — и часто succeeds.

Почему это важно для робототехники

Традиционная робототехника страдает от проблемы embodiment specificity. Каждый новый робот — это новые уравнения кинематики, новые модели динамики, новые контроллеры. Перенос политики с одного манипулятора на другой часто требует полного переобучения. Даже в симуляции transfer gap остаётся значительным: политика, обученная в Isaac Gym, может не работать в реальном мире из-за расхождений в физике.

Masked Visual Actions предлагают путь к embodiment-agnostic control. Видео-модель обучается один раз на огромном корпусе видео (где есть люди, животные, машины — всё что угодно), а затем адаптируется к конкретному роботу через минимальный fine-tuning на ~1000 демонстрациях. Маска служит универсальным интерфейсом: не важно, какой у вас манипулятор — важно, как выглядит его движение в пикселях.

Это также решает проблему sample efficiency. Традиционные методы требуют либо точных физических моделей (дорого строить), либо миллионов эпизодов взаимодействия с реальным роботом (дорого собирать). Видео-модель уже содержит prior о том, как устроен мир — её нужно лишь научить применять этот prior к конкретным действиям. Авторы показывают, что 1000 демонстраций достаточно для fine-tuning на новом embodiment — это на порядки меньше, чем требуется для обучения с нуля.

Ещё одно преимущество — counterfactual reasoning. Видео-модель может отвечать на вопросы "что было бы, если...": что если рука движется быстрее? что если чашка скользкая? что если есть препятствие? Традиционные planners могут отвечать на такие вопросы только если у них есть точная физическая модель объекта (коэффициент трения, масса, форма контакта). Видео-модель отвечает на основе выученной статистики: "Я видела тысячи видео, где похожие объекты ведут себя вот так в похожих ситуациях". Это не гарантирует физическую корректность, но часто достаточно для практических задач.

Ограничения и открытые вопросы

Метод не лишён проблем. Во-первых, видео-модели галлюцинируют. Если вы попросите их сгенерировать сцену, которой не было в training data (например, робот манипулирует объектом необычной формы), они могут выдать физически невозможные результаты — объекты проходят сквозь друг друга, руки изгибаются под странными углами. Авторы решают это через VLM-based evaluation: Gemini 3.1 Pro оценивает сгенерированные видео на физическую правдоподобность, и неподходящие траектории отбрасываются. Но это добавляет вычислительных затрат.

Во-вторых, временное разрешение. Видео-модели генерируют клипы с частотой 15 fps, что недостаточно для точного управления в реальном времени. Авторы используют интерполяцию и low-level контроллеры для сглаживания, но для высокоскоростных задач (ловля падающих объектов, быстрые манипуляции) текущий подход не подходит.

В-третьих, долгосрочное планирование. Видео-модель хороша в предсказании ближайших 5 секунд, но не может планировать на 30-секундные горизонты без иерархической декомпозиции. Для сложных задач (приготовление блюда из 10 шагов) требуется рекурсивное применение: спланировать первый шаг, сгенерировать видео, обновить состояние, повторить.

Наконец, вопрос безопасности. Видео-модель может сгенерировать траекторию, которая приводит к коллизиям или повреждениям — особенно если маска некорректно специфицирована. В статье используется human-in-the-loop для критических задач, но для полностью автономных систем требуется дополнительный safety layer.

Что это значит для будущего робототехники

Masked Visual Actions — часть более широкого тренда: foundation models для robotics. Вместо того чтобы строить специализированные системы для каждой задачи, мы берём универсальные модели (языковые, видео, мультимодальные) и адаптируем их под конкретные приложения. Это тот же подход, что привёл к GPT в NLP и Stable Diffusion в компьютерном зрении.

Практический вывод: если вы работаете в робототехнике, стоит обратить внимание на video foundation models. Они не заменят полностью традиционные методы (физическое моделирование всё ещё нужно для safety-critical applications), но они предлагают мощный prior для быстрой адаптации к новым задачам и новым роботам. Через 2-3 года мы, вероятно, увидим коммерческие системы, где робот "обучается" новой задаче не через программирование, а через просмотр нескольких демонстраций — как это делает человек.

Для исследователей это также открывает интересные вопросы. Как улучшить физическую точность видео-моделей? Как эффективно интегрировать явные физические constraints? Как масштабировать подход на multi-agent сценарии (несколько роботов, работающих совместно)? Как обеспечить safety при использовании генеративных моделей для управления?

Часто задаваемые вопросы

Зачем использовать видео-модели, если есть физические симуляторы?

Физические симуляторы требуют точного моделирования каждого объекта: массы, трения, контактов. Для сложных сцен (деформация тканей, взаимодействие с жидкостями, работа с мягкими объектами) построение точной модели занимает недели. Видео-модель обучается на реальных данных и неявно усваивает физику без явного моделирования. Это не заменяет симуляторы для safety-critical задач, но значительно ускоряет прототипирование.

Насколько точны предсказания видео-модели?

Авторы сообщают о PSNR 22-25 dB и SSIM 0.85-0.90 на стандартных бенчмарках — это сопоставимо с физическими симуляторами для визуальных задач. Для количественных метрик (точность позиционирования) результаты варьируют: 85-92% успеха на простых манипуляциях (pick-and-place), но ниже на сложных сборочных задачах. Точность растёт с количеством демонстраций для fine-tuning.

Можно ли использовать это для мобильных роботов, а не манипуляторов?

Принципиально — да. Маска может специфицировать траекторию мобильного робота так же, как траекторию руки манипулятора. Но мобильные роботы требуют навигации в больших средах, а видео-модели ограничены 5-секундными клипами. Для долгосрочной навигации требуется иерархическое планирование, что пока не исследовано в статье.

Как это соотносится с end-to-end learning (например, RT-2)?

RT-2 и подобные модели обучаются напрямую от наблюдений к действиям. Masked Visual Actions — промежуточный подход: видео-модель не генерирует действия напрямую, а генерирует видеопредсказания, из которых извлекаются траектории. Это даёт интерпретируемость (вы видите, что модель "представляет" до выполнения действия) и позволяет использовать human feedback для валидации.

Итог

Masked Visual Actions показывают, что видео-модели — это не просто генераторы контента, но и мощные world models для robotics. Через простой механизм маскирования пикселей они учатся предсказывать последствия действий и использоваться для планирования и управления. Это не серебряная пуля — есть проблемы с галлюцинациями, временным разрешением и долгосрочным планированием. Но это значительный шаг к embodiment-agnostic, data-efficient robot learning. Если вы работаете в робототехнике, стоит следить за этим направлением: через несколько лет foundation models для robotics станут стандартом, так же как GPT стал стандартом в NLP.

← Все записи