Gemini Robotics ER 2: роботы смотрят видео и понимают, что делают
Робот, который наливает кофе, должен знать одну простую вещь: когда остановиться. Для человека это очевидно: чашка наполнилась, хватит. Для машины это до сих пор была одна из самых сложных задач в робототехнике. DeepMind 30 июля 2026 года представила Gemini Robotics ER 2, модель «воплощённого рассуждения», которая решает именно эту проблему: робот смотрит непрерывный видеопоток, отслеживает собственный прогресс и понимает, когда задача выполнена, а когда пошла не так.
Что такое Gemini Robotics ER 2
Gemini Robotics ER 2 это модель высокого уровня для роботов, своего рода «мозг», который не крутит моторы сам, а планирует. Она принимает видео, аудио и текст, рассуждает о физическом мире, строит многошаговый план и передаёт исполнение низкоуровневым моделям типа vision-language-action (VLA) или навигационным API. При этом она умеет вызывать внешние инструменты, от Google Search до любой пользовательской функции, которую объявил разработчик.
Ключевое отличие от предыдущей версии, ER 1.6, это работа с непрерывным видео вместо статичных кадров. Робот больше не делает снимок, думает, действует и снова делает снимок. Он смотрит на мир постоянно и думает параллельно с действием. DeepMind называет это устранением пауз «stop-and-think», и для физических систем это критично: робот, который замирает на две секунды посреди коридора, чтобы «подумать», это робот, в который кто-нибудь врежется.
Архитектура: оркестратор вместо монолита
Подход DeepMind состоит в разделении рассуждения и исполнения. Разработчик объявляет низкоуровневые интерфейсы управления как инструменты: VLA-модель для манипуляций, навигационный API, захват. Gemini Robotics ER 2 выступает оркестратором, который решает, какой инструмент вызвать и в какой последовательности. Потоковое видео, аудио и текст поступают в модель напрямую.
Производительность оркестрации оценивалась в трёх режимах: реальный VLA-контроллер, симуляционный VLA и человек-оператор на телеуправлении. По данным DeepMind, ER 2 стабильно обходит ER 1.6 во всех трёх режимах. Это важный сигнал: модель улучшается не только в симуляции, но и на реальном железе, где ошибки стоят дороже.
За скорость отвечает интеграция с Gemini Live API, двунаправленным стриминговым эндпоинтом, оптимизированным под задачи, чувствительные к задержкам. DeepMind показала демо с роботом Spot от Boston Dynamics: ER 2 оркеструет навигационные и манипуляторные API Spot, и робот по голосовой команде приносит пачку попкорна. Код демо выложен на GitHub в репозитории google-gemini/robotics-samples, так что сценарий можно повторить на собственном железе.
Почему отслеживать прогресс так сложно
Чтобы оценить цифры DeepMind, полезно понимать, почему темпоральное рассуждение даётся моделям тяжело. Статичное изображение позволяет ответить на вопрос «что на картинке?», но не «насколько далеко продвинулся процесс?». Прогресс физической задачи нелинеен: затяжка лампочки на 80% выглядит почти так же, как на 60%, а разница между «почти готово» и «готово» определяется долями секунды и миллиметрами. Добавьте сюда заслонённые кадры, смену освещения, дрожание камеры на голове робота, и пятиклассовая классификация непрерывного видео перестаёт казаться тривиальной. Именно поэтому предыдущие системы либо игнорировали прогресс, либо полагались на ручные эвристики вроде таймеров и счётчиков шагов, которые ломаются при любом отклонении от сценария.
Темпоральный интеллект: робот знает, когда задача выполнена
Самая интересная часть релиза это две новые способности, которые DeepMind называет основой понимания прогресса задачи.
Первая это непрерывная классификация прогресса. Каждый кадр видеопотока модель относит к одному из пяти уровней завершённости, от 0-20% до 80-100%. Это даёт роботу ситуационную осведомлённость в реальном времени: если шаг провалился, можно повторить его, а не перезапускать весь процесс с нуля. Точность ER 2 на этой задаче составляет 57.4%, что выше и предыдущего поколения, и конкурирующих фронтирных моделей. Цифра выглядит скромной, но стоит учитывать: пятиклассовая классификация непрерывных физических процессов это задача, где даже случайный уровень составляет 20%, а человеческая согласованность на границах классов далека от идеальной.
Вторая способность это точный поиск моментов (moment-finding). Модель должна указать конкретный кадр, где произошло критическое событие: например, момент, когда нужно прекратить наливать кофе. Здесь ER 2 показывает 91.3% точности при средней абсолютной ошибке 0.96 секунды. По сравнению с куда более крупными моделями она держится на их уровне, но при этом работает в четыре раза быстрее и обходится заметно дешевле по вычислениям. Субсекундная задержка здесь не маркетинговая цифра, а физическое требование: робот, который поймёт через пять секунд, что кофе перелит, уже испортил стол.
Мульти-роботная кооперация
Один робот не подходит для всех задач: колёсная платформа хороша в помещении, гуманоид лучше справляется с неровной местностью. ER 2 вводит кооперацию нескольких роботов: машины обмениваются через общее семантическое понимание сцены и передают друг другу этапы сложных задач. В качестве демонстрации DeepMind показывает совместную работу гуманоида Apollo 2 от Apptronik и мобильного манипулятора Franka F3 Duo: один робот выполняет часть задачи, второй подхватывает её там, где у первого не хватает физических возможностей.
Это шаг от «умного робота» к «умной системе роботов». Практический сценарий очевиден: склад, где робот-погрузчик, робот-курьер и стационарный манипулятор делят одну задачу, каждый делая ту часть, для которой он построен.
Пространственный интеллект и приборы
Базовые пространственные способности тоже обновились. Детекция успеха и неудачи теперь работает на сыром видеопотоке, а не на статичных кадрах. Модель ловит пролитую жидкость, поскользнувшийся предмет или смещение прямо в процессе выполнения. Чтение показаний приборов расширено за пределы круглых шкал и смотровых стёкол: цифровые дисплеи, линейные шкалы, линейки, жидкостные термометры, всего десять типов приборов. Визуальные вопросы и ответы (VQA) улучшились за счёт общего прогресса мультимодального понимания в Gemini. По внутренним метрикам DeepMind, ER 2 показывает наилучшую точность по всем основным осям: детекция успеха на изображениях и видео, бенчмарк ERQA, обобщённое чтение приборов.
Безопасность: остановиться, когда рядом человек
Для физических агентов безопасность это не дополнительная фича, а условие существования. ER 2 улучшил результаты на бенчмарках Safety Instruction Following и Human Proximity: модель следует физическим ограничениям в процессе рассуждения и отслеживает людей в рабочей зоне. В тестах гуманоид под управлением ER 2 останавливался, когда рядом появлялся человек, и самостоятельно возобновлял работу, только когда зона освобождалась.
Отдельно DeepMind представила новый бенчмарк безопасности для оркестраторов VLA: он проверяет, умеет ли фундаментальная модель навязывать ограничения безопасности, мониторить окружение, оценивать физическую осуществимость действий и, что особенно ценно, запрашивать разъяснения у человека вместо того, чтобы действовать наугад. Подробности выложены в отдельном техническом отчёте по безопасности.
От RT-2 к ER 2: как DeepMind пришла к оркестраторам
Релиз ER 2 логично вписывается в траекторию, которую DeepMind выстраивает с 2023 года. RT-2 показала, что vision-language модель может напрямую выдавать команды моторам. Gemini Robotics разделила систему на слои: медленное рассуждение и быстрое исполнение. Линейка ER, embodied reasoning, занялась именно верхним слоем, тем, который понимает сцену, планирует и проверяет результат, оставляя движение специализированным VLA-контроллерам. ER 2 доводит эту идею до практического уровня: модель впервые работает в стриминговом режиме, а не по кадрам, и впервые координирует сразу несколько машин.
Этот же паттерн «рассуждающий оркестратор плюс быстрые исполнители» мы видим и в софтверных агентах: менеджер-модель раздаёт задачи узким инструментам. Робототехника просто добавляет жёсткое физическое ограничение: задержка между решением и действием измеряется не удобством пользователя, а безопасностью людей рядом с машиной.
Почему это важно
Робототехника последних лет жила в разрыве: большие языковые модели научились рассуждать, но не умели действовать в реальном времени, а классические контроллеры действовали быстро, но не рассуждали. ER 2 это попытка закрыть этот разрыв архитектурно: рассуждающая модель в роли оркестратора, быстрые VLA в роли исполнителей, стриминговый API в роли нервной системы.
Модель уже доступна разработчикам через Gemini API и Google AI Studio, а в Gemini Enterprise Agent Platform находится в приватном превью. DeepMind выложила примеры конфигурации и промптинга, включая ноутбук для быстрого старта. Это заметно отличается от типичных робототехнических релизов, где демо остаётся на YouTube, а код не покидает лабораторию.
Стоит держать в голове и ограничения. Все бенчмарки здесь внутренние метрики DeepMind, независимой верификации пока нет. 57.4% на классификации прогресса означает, что в четырёх случаях из десяти робот ошибается в оценке собственного прогресса. Для критичных процессов это требует человеческого надзора. И хотя демо с Apollo 2, Franka и Spot впечатляют, между контролируемой демонстрацией и месяцами работы на реальном складе лежит пропасть, о которой робототехники знают лучше всех.
Часто задаваемые вопросы
Чем Gemini Robotics ER 2 отличается от обычной Gemini?
ER 2 дообучена для физического мира: она принимает непрерывный видеопоток, оценивает прогресс задач, находит точные моменты событий и оркеструет низкоуровневые контроллеры роботов. Обычная Gemini работает с текстом и статичными изображениями без привязки к физическому исполнению и темпоральным ограничениям реального мира.
Можно ли использовать ER 2 со своим роботом?
Да. Модель доступна через Gemini API и Google AI Studio. Разработчик объявляет интерфейсы своего робота (VLA-модели, навигационные API, захваты) как инструменты, и ER 2 оркеструет их вызовы. Примеры для Spot и других платформ опубликованы в репозитории google-gemini/robotics-samples на GitHub.
Насколько точно робот отслеживает прогресс задачи?
На классификации прогресса ER 2 показывает 57.4% точности, лучший результат среди фронтирных моделей, но далёкий от идеала. На поиске точного момента события 91.3% точности со средней ошибкой 0.96 секунды, что достаточно для большинства манипуляционных задач вроде наливания или сборки.
Безопасен ли робот под управлением ER 2 рядом с людьми?
По данным DeepMind, ER 2 их самая безопасная модель: она лидирует на бенчмарках следования инструкциям безопасности и обнаружения людей, останавливает гуманоида при появлении человека и возобновляет работу только после освобождения зоны. Однако все оценки внутренние, и для промышленного применения потребуется независимая сертификация.
Итог
Gemini Robotics ER 2 это не очередная демка робота на выставке, а инфраструктурный ход: DeepMind превращает рассуждающую модель в универсальный слой управления для чужого железа. Видеопонимание в реальном времени, честные цифры по темпоральным задачам, мульти-роботная кооперация и открытый доступ через API. Всё это делает релиз значимым для всех, кто строит физических агентов. Если у вас есть робот или даже симулятор, самый полезный следующий шаг: открыть примеры на GitHub и проверить, как ER 2 справится с вашей задачей, а не с показательным наливанием кофе.