Что не выучили модели мира за 30 000 часов видео

Что не выучили модели мира за 30 000 часов видео

Робот складывает бумажный лист. Руки на месте, каждый сустав там, где нужно, пальцы двигаются точно. А сама бумага в кадре складывается неправильно: гнётся не туда, сминается в случайных местах и к концу сцены выглядит совсем не так, как задумывалось. Так выглядит лучший результат модели мира Cosmos 3 после обучения на 30 000 часах видео от первого лица.

Это не курьёз одного неудачного кадра, а измеренный предел. Исследование Toyota Research Institute, Университета Иллинойса, Carnegie Mellon и Университета Джонса Хопкинса показывает: чем больше видео получает модель мира, тем точнее она повторяет движения агента. И тем меньше это помогает ей понять, что эти движения делают с предметами.

Что такое модели мира

Модели мира (world models) это генеративные видеомодели, которые предсказывают следующие кадры сцены по действиям агента. В embodied AI у них две роли: заменить физические симуляторы при обучении роботов и позволить агенту планировать, «прогоняя» варианты действий в собственном воображении.

Обе роли держатся на одной способности: предсказывать, как предметы отвечают на действия. Именно здесь физические симуляторы слабы: контакты, трение и деформации плохо поддаются точному моделированию, даже когда параметры контакта подогнаны по реальным данным.

Эксперимент: 30 000 часов и лестница данных

Авторы обучили три варианта видеодиффузионной модели Cosmos 3 от NVIDIA: Edge на 4 млрд параметров, Nano на 16 млрд и Super на 64 млрд. Каждый учился на вложенных подмножествах одного корпуса видео от первого лица: 300, 3000 и 30 000 часов. Разница между крайними точками стократная.

Корпус собран из 32 тысяч задач манипуляции, 116 типов окружений, более 1000 типов сцен и записей 14 000 участников. Статья опубликована на arXiv под номером 2610.12464.

Видео от первого лица выбрано не случайно. Это дешёвый и разнообразный источник данных о взаимодействиях: человек с камерой на голове собирает материал быстрее, чем оператор робота. Некоторые корпуса уже насчитывают десятки тысяч часов, и именно с ними связывают надежду заменить физические симуляторы обучением на реальных наблюдениях.

Вместо привычных метрик «похожести» авторы измеряют взаимодействие по двум осям отдельно. Метрика SCS (Structural Consistency Score) сегментирует и отслеживает ключевые элементы сцены в предсказанном и реальном видео, усредняя IoU масок: одна оценка для тела агента, вторая для предметов. Перцептивное качество картинки контролируется отдельно, чтобы не спутать понимание с красивой генерацией. Тесты идут на out-of-distribution бенчмарке: другие камеры, другие места, другие участники.

Результат первый: агент насыщается рано

При простом увеличении данных росли обе оси, но с разной динамикой. Точность агента прибавила 0,12 SCS на отрезке от 300 до 3000 часов и всего 0,06 на отрезке от 3000 до 30 000. Кривая выходит на плато: подгонка стандартной степенной формы даёт асимптоту 0,811.

Разрыв между агентом и миром растёт вместе с масштабом. Даже сравнение размеров моделей это подтверждает: Nano прибавила на объектах 0,14 против 0,10 у Edge.

Подача скелета заменяет данные

Ключевой ход исследования: skeleton conditioning. Кроме action-токенов, модели подают проецированную конфигурацию скелета агента в кадре. Ей больше не нужно выводить положение тела из слабого сигнала действий.

Эффект радикальный. Nano с подачей скелета на 300 часах достигает точности агента, которую обычная модель набирает только к 15 000 часам. Это сокращение данных примерно в 50 раз. Но меняется только скорость, а не потолок: обе конфигурации сходятся почти к одному пределу, 0,811 против 0,800. Дополнительное видео эту ось уже не двигает.

Авторы проверили и обратную гипотезу: не создаёт ли подача скелета короткий путь, при котором модель перестаёт учиться выводить взаимодействия из картинки. В контроле скелет случайно отключали во время обучения, сохраняя эту работу, и никакого короткого пути не нашли.

Насытив агента, авторы получили инструмент для честного измерения второй оси. И потолок объектов оказался низким.

Потолок объектов: 63% шкалы

С подачей скелета точность объектов выросла всего на 0,09 SCS за два порядка данных. Кривая замедляется: плюс 0,056 на первом отрезке и плюс 0,035 на втором. Подгонка даёт асимптоту 0,565, то есть на 30 000 часах модель уже выбрала 93% доступного ей предела. В нормированном виде агент сходится к 86% измеримой шкалы, а объекты к 63%.

Авторы проверили и размер модели. Учетверение параметров почти не изменило точность агента и подняло потолок объектов на 0,034 SCS. Чтобы закрыть оставшиеся 0,205 такими шагами, нужно примерно шесть учетверений, то есть рост числа параметров на четыре порядка. Оценка оптимистичная: она предполагает, что каждый следующий шаг даст не меньше предыдущего.

Ни данные, ни размер модели практичного пути не дают. Значит, вопрос в том, чему модель учат предсказывать.

Что не сработало

Проверили и недавние методы, нацеленные на взаимодействия. PhysisForcing локализует «физически информативные» области через 2D-трекинг точек и монокулярную глубину, а затем тренирует промежуточные признаки диффузионной модели на задачи трекинга и согласование с V-JEPA 2. На 10 000 часов перереализация этих целей не улучшила базовую модель: 0,515 против 0,513.

Причина в предположениях. Локализация и трекинг опираются на статичную камеру и неокклюдированные объекты. В видео от первого лица не выполняется ни то, ни другое: камера движется вместе с человеком, а предмет в момент контакта закрыт той самой рукой, которая с ним взаимодействует.

Шум в динамических регионах: что сработало

Свой метод авторы строят без этих предположений. Они инициализируют сетку точек в первом кадре и отслеживают её по видео трекером D4RT. Затем объединяют 3D-смещение точек, надёжность трекинга и мягкий пространственный приоритет вокруг проецируемых рук. Получается карта динамических регионов, где происходят настоящие взаимодействия.

Внутри этих регионов метод повышает уровень шума при обучении. Цель денойзинга больше нельзя выполнить, просто распространив локальную внешность на соседние пиксели, приходится предсказывать из контекста и динамики. Абляция на 10 000 часов: база 0,513, только перевешивание лосса 0,516, только динамический шум 0,526, полная комбинация 0,532. Контрольный вариант со случайными регионами того же размера даёт 0,517, почти весь выигрыш исчезает. Значит, дело именно в том, где повышается шум, а не в самой пертурбации.

На всей лестнице данных метод обгоняет базовую модель: 0,546 против 0,527 на 30 000 часов, прирост 3,7%. Но он примерно постоянен на всех бюджетах: потолок поднят, а не взят быстрее. И остаётся далеко внизу от точности агента.

Перенос на гуманоидов

Финальная проверка: работает ли это на роботах. Авторы дообучили Nano на 11 задачах симулированного бимануального бенчмарка, подавая стартовый кадр и 138-мерную траекторию состояния гуманоида, и предсказывая следующие 16 кадров на частоте 10 Гц. Оценивали на роллаутах политики EgoVLA, а не на демонстрациях.

Претрейн на человеческом видео помог всему, заметнее всего рукам: 0,63 против 0,70. Полный метод добрал ещё плюс 0,17 к точности рук, до 0,88, и плюс 0,06 к объектам. Согласие с вердиктом симулятора о результате задачи выросло с 0,67 до 0,81.

По горизонту прогноза картина повторяет главный вывод. Точность рук у лучшего варианта почти не падает: с 0,89 на втором кадре до 0,85 на шестнадцатом. Точность объектов за тот же отрезок проседает вдвое сильнее: с 0,82 до 0,71. Модель знает, где окажутся руки, но не берётся предсказать, что из этого выйдет для предмета.

Одна оговорка: объекты в симуляции твёрдые и крупные, без сложных контактов, поэтому их точность высокая у всех вариантов, от 0,70 до 0,79. Выводы о взаимодействиях сильно зависят от сложности среды оценки, и это авторы проговаривают прямо.

Почему предметы так тяжело даются

Причин две, обе фундаментальные. Первая: неустранимая неопределённость. Поведение предмета при контакте зависит от массы, трения и жёсткости, а их не восстановить точно из одного кадра. Вторая: самые важные величины вообще не видны в пикселях. Геометрия предмета видна частично, а именно та часть, где происходит контакт, закрыта рукой. Сами контакты и силы не видны никогда.

Получается, физический симулятор знает точно именно то, что модель мира не может увидеть. Но симулятор плох в сложной динамике, ради которой и придумали обучаемые модели. Каждая парадигма сильна там, где слаба другая, и авторы видят путь в гибридах: например, в дистилляции симуляторов в дифференцируемые генеративные 3D-модели частиц.

Оговорка авторов: лестница данных смешивает объём с бюджетом оптимизации, меньшие бюджеты получают меньше шагов обучения. Доведи их до сходимости, и левая часть кривой поднялась бы сильнее правой, а потолки оказались бы ещё ниже. Даже измеренные пределы выглядят оптимистично.

FAQ

Что такое SCS в этом исследовании?

SCS (Structural Consistency Score) сегментирует и отслеживает ключевые элементы сцены в предсказанном и реальном видео, усредняя IoU масок. Метрика считается отдельно для тела агента и для предметов, поэтому видно, что именно модель выучила. Даже идеальное предсказание не даёт 1,0 из-за несовершенства самого трекинга.

Почему 30 000 часов не закрыли разрыв?

Данные улучшают обе оси, но по-разному. Точность агента упирается в потолок рано, а подача скелета заменяет большую часть данных. Точность объектов сходится к уровню 0,565, потому что ключевые для контакта величины (масса, трение, геометрия под рукой) не наблюдаемы в пикселях. Разрыв закрывается постановкой обучения, а не объёмом видео.

Заменят ли модели мира физические симуляторы?

В обозримом будущем нет. Генеративные модели мира сильны в разнообразии сцен, но слабы именно там, где симуляторы точны: контакты, силы, деформации. Перспективный путь это гибрид, где симулятор даёт физическую супервизию, а модель мира добавляет реализм и разнообразие. Исследование изучает только генеративные модели, так что вопрос, лучше ли латентные предиктивные модели улавливают динамику контактов, остаётся открытым.

Итог

30 000 часов видео научили модель мира почти идеально двигать руками и почти не научили понимать последствия этих движений. Ни данные, ни размер модели, ни существующие методы супервизии не дают практичного пути закрыть разрыв.

Главный вывод исследования: разрыв закрывается постановкой обучения, а не объёмом данных. Следующий шаг для исследователей мира роботов это не новые петабайты видео, а новые цели обучения, которые переносят ёмкость модели с внешности сцены на динамику предметов. Код, чекпоинты и бенчмарк авторы обещают открыть.

Если интересно, как видеомодели справляются с физикой в других тестах, почитайте наш разбор экзамена по физике для генеративных моделей.

← Все записи