EyeRobot 2.0: активный взгляд заменяет wrist-камеры
Почти все современные роботы-манипуляторы смотрят на мир через камеры, закреплённые на запястьях. Такой дизайн удобен, пока схваченный предмет не перекроет обзор. Команда исследователей из Amazon FAR, UC Berkeley и Stanford показала, что камеры на запястьях можно убрать совсем, если научить робота двигать глазами.
В их системе EyeRobot 2.0 остаётся одна стационарная стереокамера, а точную манипуляцию обеспечивает активный взгляд. Ставка сыграла: стандартные политики без wrist-камер проваливаются с 52% успеха до 27%, а EyeRobot 2.0 закрывает этот разрыв и обгоняет пассивное стерео на 40% в реальных испытаниях. Там, где схваченный предмет перекрывает камеры на запястьях, разрыв становится двойным.
Что такое активный взгляд
Active Visual Fixation (AVF) это подход, при котором робот физически поворачивает две камеры-«глаза», сводя их взгляд на одной 3D-точке сцены. Полученные изображения обрабатываются фовеально: больше визуальных токенов получает центр кадра, где сосредоточена задача, а периферия уходит на второй план. Робот сам решает, куда смотреть и когда переводить взгляд.
Логика повторяет человеческую. Когда мы вставляем соломинку в крышку или застёгиваем молнию, глаза заранее прыгают в точки, где вот-вот понадобится максимальная детализация. Фиксация даёт три эффекта сразу: высокое разрешение там, где оно нужно, 3D-якорь для пространственных рассуждений и естественное дробление длинной задачи на короткие этапы.
Почему камеры на запястьях мешают
Камера на гриппере даёт точный обзор места захвата, но привязывает зрение к манипулятору. Это ограничивает работу с инструментами и всем телом, мешает, когда схваченный предмет закрывает объектив, добавляет смаз при быстрых движениях и усложняет конструкцию захвата. Есть и менее очевидная цена: политики с wrist-камерами плохо переиспользуют эгоцентричное видео людей, потому что у человека камеры на запястье нет.
Проверка на числах жёсткая. Если у стандартной политики забрать wrist-камеры и оставить только пассивное стерео, успех в реальных задачах падает с 52% до 27%. Именно эту потерю и компенсирует активный взгляд.
Как устроен EyeRobot 2.0
Управление взглядом разделено на два уровня. Нижний уровень это политика сервопривода: она получает языковой промпт с названием объекта и непрерывно наводит оба «глаза» на его 3D-центроид, обновляя точку фиксации 30 раз в секунду. Верхний уровень, селектор цели, решает, на какой объект смотреть в каждый момент задачи и когда переводить взгляд дальше. Новая цель выбирается раз в 15 кадров, чтобы взгляд успевал стабилизироваться, а стартовому кадру демонстрации при обучении даётся повышенный вес: первый выбор, за что хвататься, часто оказывается самым важным.
Нижний модуль тренируется с подкреплением на плотной геометрической награде. Детектор SAM3 находит объект по текстовому промпту, стереопара с FoundationStereo даёт глубину, и политика получает награду за приближение точки фиксации к центроиду объекта. Награда простая: отрицательное расстояние между текущей точкой взгляда и целью. Селектор обучается в связке с gripper-политикой поведенческого клонирования: она параллельно тренируется на видах, построенных по текущим фиксациям, а селектор награждается за взгляды, которые повышают точность предсказания её действий. Метрика здесь не банальная L2-ошибка, а расстояние Фреше между предсказанными и эталонными чанками действий активной руки, то есть руки, которая в данный момент двигается. Так последовательность взглядов возникает сама, без разметки человеческих взглядов и ручного описания этапов.
Отдельная инженерная находка касается данных. Фиксацию не нужно снимать физически на каждой демонстрации: поворот камеры вокруг оптического центра это просто искажение изображения, без 3D-реконструкции. Нужный вид рендерится из обычной стереозаписи, поэтому одна и та же камера работает на сборе данных, обучении и деплое. Для сравнения, первая версия EyeRobot собирала демонстрации камерой на 360 градусов и рендерила из них новые ракурсы; вторая версия перенесла трюк на стереопару.
Ещё один приём касается действий. Проприоцепция и чанки действий робота записываются в SE(3)-позах относительно рамки фиксации, то есть относительно направления текущего взгляда. Такое представление сжимает распределение действий, и политике проще учиться: в абляциях вариант без fixation-relative представления набирает 0.53 против 0.74 у полной системы. Авторы называют это одним из главных вкладов в результат.
Железо описано детально. Это двухрукий манипулятор I2RT YAM с 14 степенями свободы и параллельными грипперами. Стереокамера стоит между руками, в 35 сантиметрах над основанием, с наклоном 45 градусов вниз, чтобы видеть весь стол. Каждый «глаз» снимает 120 градусов по диагонали в разрешении 1600 на 1200. Демонстрации собирали через лидер-манипулятор на базе GELLO и TRLC и VR-интерфейс с гарнитурой Quest 3.
Под капотом у обеих политик трансформерный декодер с замороженным энкодером DINOv3 ViT-S/16. Изображение подаётся пирамидой центрированных кропов, а позиционные RoPE-кодировки расставляют токены по координатам и времени. Взгляд при этом работает быстрее, чем рука: политика сервопривода выдаёт новые точки фиксации на 30 герцах, тогда как gripper-политика исполняет чанки действий длиной полторы секунды.
Детали обучения тоже раскрыты. PPO (Proximal Policy Optimization) работает со стандартными параметрами: коэффициент дисконтирования 0.95, обобщённая оценка преимущества с тем же коэффициентом, десять эпох обновления с ранней остановкой, если KL-дивергенция политики превышает 0.02. Действия взгляда дискретизированы в восемь полярных направлений по два шага каждое, десять и три градуса, плюс нулевое действие. Для поведенческого клонирования поддерживается кольцевой буфер из последних ста роллаутов, чтобы сохранять разнообразие демонстраций, а от переобучения спасает десятипроцентный dropout.
Эксперименты и цифры
Данные собирали телеоперацией: 7 реальных задач и 6 задач в симуляторе MuJoCo, всего 1278 демонстраций на 287 минут записи, от 10 до 53 минут на задачу. В реальном наборе есть точные операции вроде вставки соломинки в крышку, закручивания маркера и застёгивания молнии, а есть длинные многоэтапные сценарии: открыть тостер, вытащить противень, достать сковороду, задвинуть всё обратно. Симулятор это цифровой двойник робота: авторы не занимались переносом из симуляции в реальность, а использовали его для массовых контролируемых сравнений.
Все политики, включая базовые, обучены с нуля на одних и тех же демонстрациях. Базовые политики построены на архитектуре ACT и получили ту же схему аугментаций: 95-процентный центральный кроп и случайные сдвиги с поворотами, чтобы меньше зависеть от позиционирования объектов. Авторы перебрали четыре варианта пространства действий, включая относительные и абсолютные SE(3)-позы и суставные чанки, и выбрали относительный вариант, который выиграл в симуляции. Чанки у базовых политик секундные, у EyeRobot 2.0 полуторасекундные. Каждую реальную задачу прогоняли на 25 конфигурациях сцены с ручной выверкой расстановки по оверлею камеры, чтобы условия были идентичными для всех политик, а обучение шло в трёх сидах.
Сравнение с пассивным стерео закончилось разгромом базовой политики: +40% успеха в реальных задачах и +20% в симуляции. На точных операциях разрыв особенно нагляден: вставку маркера пассивная политика доводит до конца в 4% случаев, EyeRobot 2.0 в 68%, вставку соломинки в 8% против 44%. Провалы базовой политики кучкуются именно на стадиях, где нужна точность.
С политиками ego + wrist вышло интереснее. Когда камеры на запястьях видят место захвата, системы идут вровень: 69% против 64% в пользу EyeRobot. Но стоит схваченному предмету перекрыть объективы, как wrist-политики падают до уровня пассивного стерео, а EyeRobot 2.0 сохраняет 48% против 22%. Больше чем двойной перевес там, где старый подход слепнет.
Абляции подтверждают, что работают все части механизма. Без фовеации успех падает с 66.5% до 46.5%, без стерео до 48.5%, а без фиксационно-относительных действий заметно проседает симуляция. Фовеация улучшает и точность: в фовеальной зоне ошибка позиционирования 3.51 сантиметра против 4.73 на периферии. Всего в испытаниях больше тысячи физических прогонов и 1800 в симуляции, по 25 конфигураций сцены на задачу в реальности и по 100 в симуляторе.
Что это меняет
Результат меняет не столько конкретную архитектуру, сколько баланс компромиссов в робототехнике. Если точная манипуляция больше не требует камеры на гриппере, у инженеров появляется свобода: более компактные захваты, работа с инструментами там, где камера мешала, и обучение на видео от первого лица, снятых людьми. Авторы прямо называют последнее маршрутом к сокращению разрыва между человеческими и роботизированными данными.
Активное восприятие не новая идея, но раньше оно решало другие задачи: поиск объектов, объезд препятствий, реконструкцию сцены. Системы с «шеей» робота выбирают лучший ракурс, однако не управляют вниманием внутри кадра. EyeRobot 2.0 показывает, что согласованные микродвижения глаз дают прибавку даже при уже хорошей позиции камеры.
Есть и более близкие конкуренты. Некоторые работы записывают движения глаз человека во время телеоперации и подсказывают роботу точку взгляда. EyeRobot 2.0 обходится без такой разметки. Другие учат взгляд прямо в симуляции, максимизируя награду за задачу, но такие политики плохо переносятся в реальный мир. Здесь всё обучение идёт на реальных данных, а симуляция служит измерительной линейкой для честных сравнений.
Границы возможностей
Система пока узкая. Политики обучаются под конкретную задачу, а не под мультизадачность. Головой и шеей робот не управляет: речь только о движениях глаз при хорошей позиции камеры. Наконец, взгляд работает на уровне объектов, а не их частей, хотя суб-объектная фиксация может дать дополнительную точность. Все три направления авторы оставляют на будущее и обещают открыть код симулятора.
FAQ
Что такое фовеация и почему она важна для роботов?
Фовеация это неравномерное распределение вычислений по кадру: центр изображения получает больше визуальных токенов, периферия меньше. У EyeRobot 2.0 фовеальные кропы уменьшают ошибку позиционирования с 4.73 до 3.51 сантиметра, а без фовеации успех в реальных задачах падает на 20 процентных пунктов.
Заменяет ли EyeRobot 2.0 камеры на запястьях?
Не всегда, но в ряде сценариев да. Когда камеры на запястьях видят захват, их политики работают наравне с EyeRobot 2.0. Преимущество появляется при окклюзии: система без wrist-камер сохраняет 48% успеха против 22% у конкурентов, поэтому для задач с перекрытым обзором активный взгляд выгоднее.
Нужны ли для обучения человеческие демонстрации взгляда?
Нет. Оба модуля взгляда обучаются с подкреплением на реальных данных: нижний по геометрической награде, верхний в связке с BC-политикой. Разметка человеческих взглядов не нужна, а виды для обучения рендерятся из обычной стереосъёмки простым искажением изображения.
Итог
EyeRobot 2.0 показывает, что роботам не обязательно носить зрение на запястьях. Одна стереокамера плюс активный взгляд, фовеация и фиксационно-относительные действия дают +40% к успеху точной манипуляции и двойной перевес при окклюзии. Следующие поколения манипуляторов могут смотреть как люди: не туда, куда их поставили, а туда, куда важно в эту секунду.
Детали, видео испытаний и код симулятора обещают выложить на проектной странице eyerobot2.github.io, сама статья доступна на arXiv. А где ещё, по-вашему, активный взгляд обыграет статичные камеры? Ответы читаем в Telegram.