DenseReward: как плотные награды ломают потолок имитационного обучения роботов

DenseReward: как плотные награды ломают потолок имитационного обучения роботов

Современные роботы умеют хватать предметы, перекладывать их и собирать стаканы, но только потому, что кто-то тысячами часов записывал, как это делает человек. Имитационное обучение (imitation learning) довело манипуляцию до впечатляющего уровня, однако у него есть жёсткий потолок: робот не может стать лучше своего учителя. reinforcement learning (RL) обещает этот потолок пробить, но на практике упирался в другую стену, отсутствие сигнала, который объяснял бы роботу, что именно он делает не так в каждый момент времени. Статья «DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation», опубликованная в июле 2026 года, предлагает решение обеих проблем одновременно.

Почему роботы застряли в имитации

Представьте, что вы учитесь играть в шахматы, но после каждой партии вам говорят только «выиграл» или «проиграл», без комментариев, какой ход был ошибочным, в какой момент позиция стала проигрышной и почему. Именно в таких условиях работают современные RL-алгоритмы для роботов-манипуляторов. Награда приходит только в конце эпизода: схватил объект, единица, уронил, ноль. Между первым и последним кадром, сотни шагов полной темноты. Алгоритм не понимает, было ли движение руки к объекту правильным, хват успешным, а подъём, плавным. Эта проблема называется credit assignment, и именно из-за неё RL для роботов требует несоразмерно большого количества попыток.

Плотные награды (dense rewards) решают задачу: они дают оценку на каждом кадре. Робот хватает предмет, награда растёт, предмет соскальзывает, падает, объект достигает цели, фиксируется максимум. В теории всё просто, на практике, почти нерешаемо. Дизайнить такие награды вручную для каждой задачи невозможно, а существующие vision-language reward models (VLM-reward) упираются в другую фундаментальную проблему: их обучают на успешных траекториях, а значит, они плохо понимают, что именно пошло не так.

Псевдонеудачи не работают

Авторы DenseReward начинают с критического наблюдения: современные reward-модели, включая RoboReward и Robometer, пытаются решить проблему нехватки данных о неудачах через аугментацию. RoboReward обрезает успешные эпизоды на промежуточных кадрах и помечает обрезок как «неудачу». Robometer строит preference-пары из субоптимальных роллаутов. Звучит разумно, но есть нюанс: ни одна из этих стратегий не воспроизводит реальные физические отказы.

В настоящем мире робот сталкивается с совершенно другими сценариями. Схватка соскользнула с объекта, это не «обрезанная успешная траектория», это специфическое событие, у которого своя визуальная сигнатура. Объект застрял на краю стола и упал при перемещении, это тоже не то, что модель увидит в успешной демонстрации, обрезанной на середине. Коллизия gripper'а с препятствием, неожиданный отскок, попытка восстановления после проскальзывания, всё это failure modes, которых нет в обучающих данных. DenseReward формулирует это строго: pseudo-failures не покрывают distribution real robot failures, и именно поэтому существующие reward models дают ошибку 0.23–0.36 на реальных данных.

Автоматическая фабрика неудач

Вместо того чтобы обрезать успехи, авторы построили пайплайн, который генерирует неудачи напрямую в симуляции, без участия человека и без ручной разметки. Идея в том, что симулятор физически достоверен: если в нём намеренно внести возмущения, робот выполнит траекторию, которая закончится реалистичным провалом. Эти траектории автоматически получают failure-аннотации и плотные reward-метки.

Пайплайн работает так. Сначала сцена инициализируется случайно: объект и контейнер-цель оказываются в произвольных позициях на столе. GraspNet генерирует до 50 кандидатов на хватку из multi-view RGB-D наблюдений, CuRobo планирует траекторию, симулятор проигрывает. На этом этапе всё выглядит как обычная успешная демонстрация. Дальше в ключевых точках вносятся targeted perturbations: в момент grasping gripper закрывается не полностью, в момент lift объект получает боковой импульс, в момент move платформа под объектом сдвигается. Эти возмущения не разрушают сцену катастрофически, они достаточно тонкие, чтобы траектория продолжилась, но достаточно выраженные, чтобы привести к realistic failure modes.

Результат, датасет с четырьмя категориями отказов: collisions (коллизии gripper'а с окружением), missed grasps (соскальзывание), object drops (падение при перемещении) и recovery behaviors (попытки восстановить контроль). Каждая траектория размечена пофазово, без единого часа ручной работы.

Пять фаз вместо одного бинарного ответа

DenseReward не просто предсказывает «успех/неудача» на весь эпизод. Модель декомпозирует манипуляцию на пять канонических фаз. Reach, рука движется к объекту. Grasp, gripper закрывается. Lift, объект поднят над поверхностью. Move, объект транспортируется к цели. Place, объект отпускается в целевой позиции. Каждая фаза имеет свою визуальную сигнатуру и свой диапазон награды от 0 до 1.

Такая декомпозиция даёт два преимущества. Во-первых, reward-сигнал становится информативным: модель знает, что на фазе Reach успех определяется расстоянием до объекта, а на фазе Place, точностью позиционирования. Во-вторых, при возникновении failure модель может локализовать, на какой фазе произошёл сбой. Если робот успешно прошёл Reach и Grasp, но уронил объект на Lift, DenseReward покажет резкое падение награды именно в момент Lift, и эта информация направит policy в правильную сторону при следующем RL-шаге.

Архитектурно модель построена на vision-language backbone: визуальные наблюдения из нескольких камер комбинируются с языковой инструкцией (например, «положи красную чашку в синий контейнер») и проходят через трансформер, который предсказывает скалярную награду на каждом timestep. Обучение ведётся на смеси успешных и сфабрикованных неудачных траекторий с phase-aware dense reward labels.

Цифры: в три раза точнее всех

Результаты на бенчмарке плотного предсказания наград говорят сами за себя. DenseReward достигает средней абсолютной ошибки (MAE) 0.081, это усреднение по четырём источникам данных: DROID, Isaac Sim, RoboSuite и LIBERO. Для сравнения: RoboReward-8B, предыдущий лидер среди роботизированных reward-моделей, даёт 0.230. Robometer показывает 0.366. Даже мощные VLM общего назначения, Qwen3-VL-4B и Qwen3-VL-8B, не опускаются ниже 0.289. Разрыв в 2.8–4.5 раза.

Особенно показательна разница на data source DROID, реальные демонстрации, собранные на физических роботах. Здесь DenseReward даёт 0.259 против 0.484 у RoboReward-8B и 0.538 у Qwen3-VL-8B. Это означает, что модель хорошо обобщается за пределы симуляции, для которой она обучалась. На симулятивных бенчмарках (Isaac Sim, RoboSuite, LIBERO) ошибка ещё ниже, 0.044–0.081, что говорит о стабильности обучения.

Качественно это видно и на графиках: reward-кривые DenseReward плавно растут по мере приближения к цели и резко падают при возникновении failure. Кривые базовых моделей либо зашумлены, либо вообще не реагируют на промежуточные события, они предсказывают примерно одинаковую награду на протяжении всего эпизода.

downstream-задачи: MPC и RL

Предсказать награду, это полдела. Важно, чтобы эта награда реально улучшала поведение робота. Авторы проверяют DenseReward в двух downstream-сценариях.

Первый, Model Predictive Control (MPC). Робот на каждом шаге выбирает действие, которое максимизирует предсказанную награду на горизонте в несколько шагов. На трёх задачах (перемещение банки, чашки и лимона) DenseReward-управляемый MPC достигает средней успешности 0.783, тогда как RoboReward-8B показывает 0.300, а VLAC-2B, 0.433. Разница особенно заметна на задаче «переместить банку»: 0.917 против 0.314 у лучшего базового метода.

Второй сценарий, reinforcement learning fine-tuning. Берётся предобученная VLA-модель (Vision-Language-Action), и её дообучают on-policy RL-алгоритмом, используя DenseReward как reward function. На наборе задач манипуляции средняя успешность вырастает до 63.2%, тогда как RL с RoboReward-8B даёт 47.8%, а RL с Robometer, 36.7%. Прирост в 15.4 процентных пункта против ближайшего конкурента, это существенная разница, которая на практике означает, что робот выполняет каждую вторую задачу вместо каждой третьей.

Архитектурные детали и обучение

Модель построена на базе Molmo2-4B, vision-language backbone, который принимает multi-view RGB-D изображения и текстовую инструкцию задачи. Архитектура модифицирована: вместо текстового вывода (next-token prediction) к финальному слою добавлена regression-головка, предсказывающая скалярное значение награды от 0 до 1. Обучение ведётся с MSE loss между предсказанной наградой и ground truth из automated pipeline.

Датасет включает успешные траектории из симулятора (с разнообразными пространственными конфигурациями объектов) и сфабрикованные неудачи, всего порядка нескольких тысяч эпизодов с пофазовой разметкой. Каждый эпизод содержит 100–300 кадров с соответствующими reward-метками. На валидации используется holdout set из реальных демонстраций DROID, что обеспечивает честную оценку generalization. Время обучения на 8×A100 составляет менее суток, что делает подход воспроизводимым даже для небольших лабораторий.

Ключевой дизайн-решение, использование multi-view наблюдений. Одна камера часто не видит, что происходит с gripper'ом или объектом из-за окклюзий, а три-четыре камеры с разных углов дают модели полную картину манипуляции. Это особенно важно для фаз Grasp и Place, где тонкие визуальные изменения (захват лишний миллиметр в сторону, неточное позиционирование над контейнером) определяют успех или неудачу.

Почему это важно для всей области

DenseReward, это не просто ещё одна reward-модель. Это демонстрация того, что главный bottleneck роботизированного RL, не алгоритмы и не вычислительные мощности, а данные. Пока не было реалистичных failure trajectories, reward-модели не могли давать плотный сигнал. Пока не было плотного сигнала, RL оставался sample-inefficient. Пока RL был sample-inefficient, индустрия была вынуждена полагаться на имитационное обучение с его жёстким потолком.

Цепочка разорвана на первом звене. Автоматическая фабрика неудач в симуляции генерирует данные без человека. Плотная пофазовая модель превращает эти данные в информативный reward-сигнал. RL-алгоритм использует этот сигнал для fine-tuning policy beyond imitation ceiling. Всё это open-source: авторы выпустили датасет, обученные модели и evaluation suite.

Для индустрии это означает, что роботы-манипуляторы на складах, фабриках и в лабораториях могут начать адаптироваться к новым задачам без тысяч часов телеоперации. Для исследователей, что reward modeling перестал быть узкой инженерной задачей и превратился в область с чёткими бенчмарками и открытыми данными.

Часто задаваемые вопросы

Чем DenseReward отличается от обычных reward models для роботов?

Большинство reward-моделей предсказывают единственную оценку за всю траекторию, успех или неудача в конце эпизода. DenseReward предсказывает награду на каждом кадре видеопоследовательности, причём с учётом фазы манипуляции. Это даёт RL-алгоритму сигнал для credit assignment, понимание, какие именно действия привели к успеху или провалу.

Можно ли использовать DenseReward вне симуляции?

Да, и это подтверждено экспериментально. На реальных данных DROID ошибка DenseReward составляет 0.259, это значительно ниже, чем у конкурентов. Модель обучена на синтетических данных, но обобщается на реальные манипуляции благодаря разнообразию failure-сценариев и пофазовой декомпозиции.

Насколько дорого генерировать failure-данные в симуляции?

Авторы подчёркивают, что пайплайн полностью автоматический: targeted perturbations вносятся программно, аннотации генерируются из фазовой декомпозиции, human labeling не требуется. Стоимость определяется временем симуляции, которое на порядки дешевле телеоперации. Для сравнения: сбор датасета Open X-Embodiment потребовал тысяч часов ручного управления роботами.

Итог

DenseReward закрывает разрыв между имитационным обучением и reinforcement learning для роботической манипуляции. Автоматическая фабрика неудач решает проблему данных, пофазовая декомпозиция, проблему информативности сигнала, а открытая лицензия, проблему воспроизводимости. С ошибкой предсказания 0.081 и downstream-успешностью 63.2% в RL fine-tuning, это первый reward model, который реально делает RL для роботов практичным. Если вы работаете с VLA-моделями, robotic manipulation или RL, DenseReward стоит изучить в первую очередь.

← Все записи