Ledger: как ИИ-ассистент запоминает, где лежат вещи
Вы точно знаете, где в квартире лежат запасные батарейки, даже если последний раз видели их месяц назад. Человек постоянно ведёт мысленную карту мест, где находятся потенциально важные объекты, и это избавляет от необходимости пересматривать воспоминания или обшаривать комнату заново. У ИИ-ассистентов и роботов такого умения до недавнего времени не было: одни системы забывают объект, едва он уходит из кадра, другие требуют заново пересматривать часы записи при каждом вопросе.
Новая работа Never Look Back («не оглядывайся», arXiv:2610.10538) предлагает третий путь. Исследователи построили Ledger, постоянную 3D-память объектов из эгоцентричных видео, которая отвечает на пространственные вопросы по компактным текстовым записям, не обращаясь к кадрам и исходному видео. Точность ответов на самом сложном наборе выросла с 29,7% до 42,6%, а чтение памяти стоит в пять раз меньше токенов, чем просмотр кадров.
Что такое Ledger
Ledger расшифровывается как Long-horizon Egocentric Descriptions, Geometry, and Event Records. Это постоянная 3D-память объектов, которая строится офлайн из записи от первого лица. Она хранит расположение объектов, историю их перемещений и короткие текстовые описания, причём включая предметы, которых человек ни разу не касался. Вопросы о сцене система разбирает по своим записям: языковая модель получает только текст и не видит ни одного кадра.
Установка здесь важнее технических деталей. Агент наблюдает за обычной жизнью человека, не управляя ни его взглядом, ни его действиями. Именно так выглядит реалистичный сценарий для домашнего робота или носимого ассистента, которому нужно запоминать обстановку без специальной съёмки.
Почему это сложно
Построить такую память из записи обычного дня непросто. Объекты перекрывают друг друга, мелькают в кадре на секунды или попадают в поле зрения под непривычным углом. Они перемещаются между наблюдениями, а ошибки 3D-локализации легко превращают неподвижный предмет в «путешествующий»: если записывать сырые позиции, шум измерений выглядит как движение.
Есть и вторая сложность. Агент заранее не знает, какие объекты окажутся важными: вопрос может касаться чего угодно, включая вещь, мелькнувшую в кадре один раз. Решение о том, что сохранять, приходится принимать до того, как станет известна цель.
Как устроена память
Система размечает объекты открытым словарём. Модель Qwen3.5-9B называет предметы в выборочных кадрах, из названий собирается словарь для детектора YOLO-World, а WildDet3D оценивает 3D-боксы и переносит их в координаты сцены через позу камеры. Ключевое проектное решение: в память попадают все объекты в пределах бюджета детекции, а не только те, что человек взял в руки. Именно так система отвечает на вопросы о мебели, посуде и других предметах обстановки, которых никто не трогал.
Дальше наблюдения каждого объекта группируются в сегменты покоя. Каждый сегмент объединяет наблюдения рядом с одной точкой, где объект лежит, а начало нового сегмента означает перемещение. Но перемещение фиксируется только после того, как несколько последовательных наблюдений подтвердят смещение. Это правило устойчивости защищает от шума локализации, и авторы объясняют его показательными числами: половина реальных перемещений короче 0,8 метра, а 95-й процентиль ошибки локализации достигает 0,84 метра. Движение и шум пересекаются по величине, поэтому одиночный порог их не разделяет. Комбинация порога 0,3 метра и требования трёх подряд смещённых наблюдений доводит точность подсчёта перемещений до 67,4% против 57,3% у одного порога. Цена решения: короткие перемещения система может пропустить.
Отдельная задача в конвейере: идентичность объектов. Детектор и 3D-сопоставление могут разбить один и тот же предмет на несколько треков, потому что объект подолгу не попадает в кадр, появляется под другим углом или в другой части комнаты. Второй проход с видео-трекером SAM 3 распространяет маски по кадрам и сливает фрагменты, чьи маски согласуются, с проверками на совместную встречаемость и расстояние в 3D. Записи переживают уход объекта из кадра, хотя большое перемещение может создать новую идентичность.
Каждый сегмент получает короткое описание: что лежало в контейнере, на какой поверхности стоял предмет, что с ним делали. Деталь важная, потому что описания спасают там, где ошибается детектор: если система неверно назвала объект, описание сегмента подскажет, что человек держал в руках, и отвечающая модель выберет верный вариант. Дополнительно мультиракурсная триангуляция уточняет координаты, когда объект виден с хорошо разнесённых точек.
Как система отвечает на вопросы
На этапе вопроса система определяет, о каких объектах идёт речь, достаёт их записи и передаёт языковой модели метки, историю сегментов, время, позиции и описания. Модель отвечает по этому тексту: один вызов, около 2 тысяч входных токенов на вопрос. Те же 48 кадров, которыми пользуются кадровые системы, стоят 9,6 тысячи токенов. Для запросов с боксами из HD-EPIC система поднимает их к 3D-точке ближайшего кадра, а для вопросов по названию объекта возвращает сохранённую позицию из записей.
Для вопросов с отметкой времени память фильтруется: записи после момента вопроса удаляются, история и путь носителя обрезаются. Так проверяется, что система отвечает из состояния памяти на тот момент, а не из подсмотренного будущего. Правда, построение памяти всё равно офлайн, поэтому причинную онлайн-память эксперименты не проверяют, и авторы это честно оговаривают.
Результаты
На HD-EPIC, где собраны 2 400 вопросов о 3D-восприятии и движении объектов, GPT-5.4 вслепую набирает 29,7%, а с памятью Ledger уже 42,6%. Пересобранные на тех же кадрах конкуренты заметно ниже: DirectMe 30,7%, ReMEmbR 29,8%, OSNOM 30,2%, AMEGO 34,7%. Для ориентира: человек на выборке отвечает с точностью 93,3%.
На UCS-Bench (2 771 вопрос с отметками времени) память в одиночку даёт 38,5% против 33,8% у слепого контроля, а связка «48 кадров плюс память» выходит на 46,3% против 42,9% у связки с графом DirectMe. Наконец, в задаче именованной локализации Ego4D VQ3D память возвращает позиции объектов с медианной ошибкой 0,99 метра, тогда как ReMEmbR ошибается на 1,49 метра, а граф DirectMe на 1,91. В пределах метра укладывается 51% предсказаний.
Отдельный результат про длину записей. Преимущество памяти не тает со временем: на отрезках до 75 минут она держится на 10–18 пунктов выше слепого контроля, тогда как ни одна из пересобранных памятей не даёт больше 5 пунктов. Кадровые читатели, наоборот, теряют точность с ростом длины записи, а память нет.
Ещё один аргумент в таблице сравнения. В обзоре авторов собраны 12 систем памяти, и только Ledger закрывает все требования: учёт нетронутых объектов, история перемещений, ответы без доступа к кадрам и работа при смене сцен.
Разница видна и в том, что хранят конкуренты. Многие системы памяти записывают только объекты, с которыми человек взаимодействовал руками, а предметы обстановки пропускают. Ledger показывает, что именно нетронутые объекты дают самый заметный прирост на вопросах о расположении вещей: их добавление расширяет доказательную базу, которую контактные системы просто не видят.
Что на самом деле важно
Абляции показывают вклад компонентов, и расклад получается неочевидным. Правило устойчивости добавляет 5,5 пункта на подсчёте перемещений, контекстные описания 4,9, а уточнение координат триангуляцией всего 2,2. Дисциплина записи и текст значат больше, чем лишняя точность геометрии.
Ещё интереснее с позами камеры. Ошибки позы вредят сильнее, чем ошибки координат объектов: на вопросах о расположении предметов оценённые позы стоят 11 пунктов точности, а без учёта гравитации все 29. Направление ответа зависит от ориентации камеры, поэтому именно позы определяют правильность ответа, тогда как координаты нужны для метрической локализации.
Где память ломается
Слабое место находится на стыке сцен. В эксперименте со 100 сшитыми потоками, где запись переходит из помещения в помещение, возвращение в знакомое место почти ничего не стоит памяти, а смена сцены роняет точность до уровня слепого контроля. Оба этапа, и извлечение, и построение, неявно предполагают одну сцену: поиск достаёт записи из чужих сцен, а конструктор отбрасывает метки, которые не могут принадлежать одному месту, и отклоняет весь поток на шве. Построение памяти отдельно для каждой обнаруженной сцены восстанавливает примерно половину потерь.
Авторы не скрывают и остальных ограничений. На HD-EPIC свежие системы, читающие кадры напрямую, всё ещё точнее памяти без кадров, хотя добавление памяти улучшает и их. Подсчёт объектов и непрерывные интервалы покоя остаются нерешёнными, а конструкция не масштабируется на самые насыщенные по объектам часовые записи. Часть наборов данных лишена метрического масштаба, а на HD-EPIC позы камеры калиброваны, и в реальных условиях оценка поз отнимет часть точности.
Почему это важно
Ставка здесь больше, чем один бенчмарк. Домашним роботам, embodied-ассистентам и носимым устройствам нужна память о физическом мире, которая переживает уход объекта из кадра и не требует хранить всё видео. Подход «сжатые записи вместо кадров» уже сейчас дешевле в пять раз и точнее на пространственных вопросах.
Шире говоря, такие работы показывают, что память для ИИ не про объём хранения, а про дисциплину отбора: что записать, когда обновить, что считать подтверждённым. Ledger отвечает на эти вопросы конкретными правилами, и именно поэтому его записи переживают и уход объекта из кадра, и 75 минут записи.
Часто задаваемые вопросы
Ledger заменяет видеомодели?
Нет. На HD-EPIC системы, читающие свежие кадры, всё ещё точнее памяти в одиночку, а на UCS-Bench одни кадры дают 44,4% против 38,5%. Но память дешевле в пять раз и дополняет кадры: добавление записей поднимает точность до 46,3%, лучшего результата среди сравниваемых конфигураций.
Почему нельзя просто поставить порог смещения?
Потому что реальные перемещения и ошибки локализации пересекаются по величине: половина перемещений короче 0,8 метра, а 95-й процентиль ошибки достигает 0,84 метра. Порог либо пропускает движения, либо считает шум перемещениями. Требование нескольких подтверждающих наблюдений решает проблему иначе.
Можно ли перенести подход в роботов?
Архитектура к этому готова: система работает и с оценёнными позами камеры, а не только с калиброванными. Ограничения тоже переносятся: без метрического масштаба и с офлайн-построением до памяти в реальном времени ещё далеко.
Насколько это дорого в эксплуатации?
Память строится один раз на запись, локально и без обращений к API, поэтому её стоимость измеряется временем вычислений, а не токенами. На ответах система читает около 2 тысяч токенов на вопрос против 9,6 тысячи у 48 кадров, а многошаговые агенты-читатели тратят до 23 тысяч токенов за три-четыре вызова.
Итог
Ledger показывает, как ИИ-память может хранить не видео, а компактные записи о местах и истории объектов. Несколько правил отбора, сегменты покоя и короткие описания дают +12,9 пункта на HD-EPIC, медианную ошибку локализации 0,99 метра и в пять раз меньшую стоимость чтения, чем у кадров. Главный урок шире бенчмарков: память сводится к дисциплине отбора, а не к размеру хранилища.
А что должна запоминать домашняя система на ваш взгляд: каждый объект в поле зрения или только то, что человек трогал?