Обучение роботов без демонстраций: SUN Programs от UCLA

Обучение роботов без демонстраций: SUN Programs от UCLA

0,07%. Именно такой средний успех показывает чистый reinforcement learning с наивной наградой на девяти многоэтапных задачах манипуляции в свежей статье UCLA. Система Kuafu, которую авторы противопоставляют этому провалу, решает те же задачи с результатом 82,03%. Разница в тысячу раз достигается без единой человеческой демонстрации и без единой строчки вручную написанной функции награды.

Секрет в том, что Kuafu не выбирает между классическим управлением и обучением. Она заставляет их работать вместе через общий артефакт: типизированную исполняемую программу, которую исследователи назвали SUN Program.

Что такое SUN Programs

SUN Program (Semantically UNified Program) это типизированное исполняемое описание задачи манипуляции, где геометрические и контактные отношения между объектами определяются один раз, а затем компилируются сразу в несколько форм: функции стоимости для Model Predictive Control, предикаты выполнения, награды для RL, условия перехода между этапами и диагностику ошибок.

Проще говоря, это единый источник правды о задаче. Инструкция «поставь бутылку на стол» перестаёт быть расплывчатым текстом и становится набором формальных отношений: что считать вертикальным положением, какой контакт допустим, когда этап завершён. Из этого описания автоматически выводится всё остальное, что нужно и контроллеру, и обучаемой политике.

Молчаливое разногласие между контролем и обучением

Авторы начинают с наблюдения, которое они называют тихим конфликтом двух парадигм робототехники. Model-based control умеет исполнять точно заданные цели, но требует идеальной модели мира: малейшая ошибка в оценке состояния, шум в наблюдениях или неточность в спецификации, и контроллер ломается. Обучение, наоборот, умеет вырабатывать реактивные политики, устойчивые к таким ошибкам, но за это приходится платить ручным конструированием плотных наград.

Существующие протоколы передачи поведения от контроллера к политике теряют самое ценное. Контроллер генерирует удачные траектории, по ним тренируют политику, но семантика задачи выбрасывается: почему действия были правильными, где границы этапа, что считается успехом. В результате награды, которые видит политика, дрейфуют в сторону от спецификации, которую проверил контроллер.

Попытки автоматизировать генерацию наград, как в Eureka, страдают от фатальной задержки: качество кандидатной награды можно оценить только после полного цикла обучения политики и роллаута. Каждая итерация ревизии стоит полный цикл тренировки. Kuafu предлагает выход: проверять программу задачи до обучения, через физику.

Как работает Kuafu

Конвейер начинается с текстовой инструкции и зарегистрированной семантики сцены: идентичности объектов, их пространственные и геометрические свойства. LLM-агент (в экспериментах использовался GPT-5.5) конструирует SUN Program, выбирая операторы из типизированной библиотеки и связывая их с объектами сцены.

Дальше программа проходит закрыто-цикловую проверку в физическом симуляторе Isaac Lab через MPC. Если программа не проходит скрининг, система не переписывает её целиком: диагностика указывает на конкретные упавшие условия, и механизм восстановления чинит отдельные термы. Принятая программа становится «ментором»: MPC генерирует успешные траектории, по ним обучается stage-conditioned политика через поведенческое клонирование, а затем остаточный RL в жёстких границах доводит контроллер до финального качества. Программа при этом сохраняется на протяжении всего жизненного цикла и продолжает поставлять контекст этапов и сигналы обучения.

Важно, что downstream-компоненты даже не знают о существовании программы. Визуальные политики и zero-shot деплоймент используют только сгенерированные наблюдения и действия.

Анатомия передачи: prior плюс ограниченный остаток

Центральная инженерная идея Kuafu это разделение политики на две части. Сначала Stage-BC клонирует поведение MPC-ментора и даёт грубый, но уже осмысленный контроллер: он знает структуру этапов, хотя и исполняет их неточно, всего 24,75% успеха в одиночку. Затем поверх него обучается остаточная политика, которая добавляет корректирующее действие в строго ограниченных границах. Границы не декорация: авторы показывают, что их снятие или расширение обрушивает успех всех девяти задач в ноль. Остаток не может «уйти в сторону» от проверенного поведения, он только локально доводит контакты и точность.

На скалярное уточнение отводится максимум пять итераций остаточного RL на задачу. Итерация признаётся коллапсировавшей, если финальный успех падает ниже 50% от пика, и в этом случае уточнение останавливается на последней неколлапсировавшей конфигурации. Это простая, но эффективная защита от катастрофического дрейфа политики, знакомого каждому, кто трогал RL fine-tuning поверх клонированного prior.

Авторы вводят понятие lineage: целостная цепочка, связывающая принятую программу, сгенерированные MPC траектории, Stage-BC prior, ограниченный остаточный контроллер и финальную оценённую политику. Именно сохранение этой цепочки целиком, а не только пар «наблюдение, действие», отличает Kuafu от классической схемы «контроллер генерирует демонстрации для imitation learning».

Почему разреженные награды проигрывают на длинных горизонтах

Результат 0,07% у чистого RL с наивной наградой выглядит экстремально, но он объясним. В задаче из восьми-пятнадцати этапов награда за финальный успех наступает после сотен точных действий подряд. Вероятность случайно наткнуться на полную успешную траекторию падает экспоненциально с длиной горизонта, а сигнал присвоения заслуги конкретным действиям растворяется. Это классическая проблема credit assignment, обострённая контактной физикой: маркер либо попал в отверстие стакана, либо нет, промежуточной награды природа не предоставляет.

Ручные плотные награды решают эту проблему ценой хрупкости: авторы отмечают, что небольшие правки весов и порогов переходов радикально меняют выученное поведение. SUN Programs предлагают третий путь: плотный сигнал не выдумывается инженером, а компилируется из формальной спецификации, которую предварительно проверил физический контроллер. Поэтому он одновременно информативен и согласован с тем, что реально исполнимо в симуляции.

Надёжность синтеза: от 64% к 96%

Первая проверка касалась того, насколько надёжно LLM вообще способен выводить рабочие программы из языка. Программы для девяти задач оказались серьёзными: от 3 до 15 этапов и от 12 до 53 ограничений каждая.

Из 45 независимых запусков формирования и MPC-валидации 29 прошли сразу, то есть 64,4%. Диагностический ремонт принял 14 из оставшихся 16, подняв итоговую приёмку до 95,6%. Наиболее показательны задачи T4 (поставить бутылку) и T5 (вставить маркер в стакан): восстановление подняло их приёмку с 1 из 10 до 10 из 10.

Любопытно, что размер программы сам по себе не предсказывает сложность. Самая большая 15-этапная программа для стекинга трёх кубов прошла все пять запусков без единого ремонта. А вот задача T7, объединяющая выдвижение ящика с точным pick-and-place, осталась единственной с неустранимыми запусками. Авторы делают вывод, что проблема не в длине, а в комбинировании разнородных фаз манипуляции.

Отдельная строка в таблице посвящена стоимости языкового взаимодействия. Kuafu тратит в среднем 110,5 тысячи токенов на задачу, и это разовая стоимость. Eureka сжигает 234,4 тысячи на одноразовый поиск награды. VoxPoser платит 31,6 тысячи токенов за каждый роллаут, так что его накопленные расходы превышают Kuafu уже после четырёх выполнений. Персистентная программа превращает языковое взаимодействие из повторяющейся операционной стоимости в разовую стоимость уровня задачи.

Результаты: 82% против 35,7%

Девять задач в Isaac Lab покрывают типовые бытовые манипуляции: нажатие и вращение аварийной кнопки, стекинг двух и трёх кубов, открытие ящика с размещением объекта, возвращение бутылки в вертикальное положение, вставка маркера в стакан, подвешивание кружки за ручку. Все state-controller оценки гонялись на 8192 параллельных окружениях с лимитом 180 секунд на роллаут.

Полный конвейер Kuafu достигает 82,03% макро-успеха. Идентичная архитектура с разреженными наградами вместо программного супервизора даёт 35,67%, разница в 46 процентных пунктов при том же стартовом prior и том же остаточном обучении. Агрегат по трём независимым прогонам всей цепочки показывает 79,43%, так что результат не артефакт одной удачной линии наследования. Уровень ложных завершений после передачи составляет всего 0,60%.

Абляции раскладывают вклад компонентов. Stage-BC сам по себе даёт только 24,75%. Чистый RL с наградой из SUN Program, но без проверенного prior, даёт ровно 0%: программа без поведенческого якоря бесполезна. Остаточный RL поверх stage-free клонирования достигает лишь 18,56%. Удаление границ остаточного действия обрушивает все задачи в ноль. TD-MPC2 с наивной наградой берёт 12,63%, а с добавлением поведенческого prior поднимается до 31,95%, но успех концентрируется в трёх простейших задачах.

Бейзлайны с итеративным поиском наград выглядят особенно поучительно. Eureka показывает немонотонную нестабильность: лучший кандидат за пять раундов поиска достигает 18,24%, но финальная политика деградирует до 12,85%. На задаче T0 успех падает с 45,14% до 0,21%, классический симптом оверфитинга награды под прокси-метрику. VoxPoser с онлайн-планированием берёт только 10%, полностью проваливая пять задач из девяти.

Эффективность данных и переход на реальное железо

Вторая половина истории про генерацию данных. На масштабе 8192 параллельных окружений Kuafu производит в 10,57 раза больше успешного времени траекторий в час, чем человеческая телеоперация. Это прямой ответ на главный бутылочный горлышко робототехники: демонстрации дороги, а здесь их нет вообще.

Качество сгенерированных данных проверили честно: 500 траекторий на задачу, фиксированный объём, обучение DP3-политик. Данные Kuafu дают 46,0% успеха в симуляции против 22,4% у альтернативных методов генерации. На физических роботах Franka и Kinova визуальные политики, обученные только на синтетических траекториях Kuafu, достигают 34,7% успеха при zero-shot переносе. Всего авторы провели 106 физических испытаний, а датасет поддержал восемь однозадачных визуальных архитектур и три мультизадачные VLA-модели.

Почему это важно

Работа формулирует принцип, который звучит почти банально, но до сих пор не был продемонстрирован end-to-end: семантика задачи, проверенная через управление, остаётся эффективной даже после того, как поведение амортизировано в обученную политику. Символическое планирование и data-driven исполнение перестают быть конкурентами.

Практическое следствие заметно любому, кто пробовал RL для манипуляции. Конструирование наград это главный скрытый трудоёмкий процесс, и каждая новая задача начинает его с нуля. SUN Programs предлагают переиспользуемый артефакт: библиотека типизированных операторов растёт, а стоимость новой задачи сводится к стоимости одного LLM-диалога и одного MPC-скрининга.

Ограничения

Авторы честно фиксируют границы. SUN Programs опираются на зарегистрированный интерфейс сцены с информативными осями объектов и на конечную библиотеку операторов. Деформируемые объекты и жидкости недоступны без определения новых операторов. Оценка не покрывает отложенные инструкции, новые операторы и открытые композиции задач, так что о strong open-world обобщении речи нет. Наконец, всё завязано на качество LLM-синтеза: 4,4% запусков даже диагностический ремонт спасти не смог.

Часто задаваемые вопросы

Чем Kuafu отличается от Eureka?

Eureka ищет функцию награды итеративно, и каждая проверка кандидата требует полного цикла обучения политики. Kuafu один раз синтезирует типизированную программу задачи и проверяет её через MPC до начала обучения. Итог: 82,03% против 12,85% и вдвое меньшие расходы токенов.

Нужны ли Kuafu человеческие демонстрации?

Нет. Поведенческий prior создаётся из траекторий, которые генерирует MPC-контроллер в симуляторе. По производительности успешных траекторий система превосходит человеческую телеоперацию в 10,57 раза, а обученные на них политики работают на физических роботах Franka и Kinova.

Что такое stage-conditioned политика?

Это политика, которая получает на вход не только наблюдение, но и идентификатор активного этапа задачи из SUN Program. Это позволяет ей по-разному вести себя на фазах «подойти», «схватить» и «переместить», не смешивая их в одну усреднённую стратегию.

Итог

Kuafu и SUN Programs показывают рабочий рецепт обучения роботов без демонстраций: LLM формализует задачу, MPC проверяет её физикой, проверенные траектории становятся prior, а остаточный RL в жёстких границах доводит политику до 82% успеха. Если вы строите пайплайны генерации робототехнических данных, идея персистентной программы задачи заслуживает места в вашем инструментарии: попробуйте воспроизвести хотя бы связку «текстовая инструкция, формальная спецификация, MPC-скрининг» на своей задаче и сравните с ручным конструированием наград.

← Все записи