Atlas от World Labs: 3D-мир из одной фотографии

Atlas от World Labs: 3D-мир из одной фотографии

Три смартфона на штативах, которые помещаются в рюкзак. Это всё, что понадобилось команде World Labs, чтобы снять сцену, «заморозить время» и рассмотреть событие с ракурсов, которых физически не существовало. Раньше для такого эффекта bullet time строили студию из десятков синхронизированных камер. Теперь эту работу делает нейросеть Atlas, и она же заодно превращает пару фотографий дачи в пространство, по которому можно пролететь на виртуальном дроне.

Что такое Atlas

Atlas — новая мировая модель (world model) от World Labs, компании Фэй-Фэй Ли. Если коротко: это система, которая принимает текст, изображения, позы камер и карты глубины, а затем генерирует согласованный трёхмерный мир, оставаясь привязанной ко всему, что уже «увидела». Не очередной видеогенератор, а модель, для которой пространство является родным форматом данных.

Заявленный диапазон задач широкий: генерация видео с точным контролем камеры, реконструкция реальных сцен из одного или нескольких кадров, симуляция пространства и времени для робототехники, генерация изображений и панорам 360 градусов. Atlas войдёт в основу будущих версий Marble, продукта World Labs для генерации 3D-окружений.

Пространственный контекст вместо текстового промпта

Ключевая идея архитектуры называется spatial context. Обычная языковая модель кодирует вход в последовательность токенов. Atlas делает похожую вещь, но каждое входное изображение закреплено за конкретной позицией в 3D-пространстве. Все входы складываются в единый пространственный контекст, и генерация новых видов идёт с опорой на него.

Из этого следует неочевидная возможность: в контекст можно поместить два никак не связанных снимка, скажем, коридор вокзала и банкетный зал, разместить их в пространстве, и модель построит мир, который плавно соединяет одно с другим, домысливая дверные проёмы, переходы и коридоры между ними. Пространство становится редактируемым объектом, а не побочным продуктом генерации.

Бонусом идут генерация изображений по текстовым описаниям и панорамы 360 градусов. Для Atlas это почти побочный эффект: если каждая картинка для модели является окном в некоторый мир, то «просто картинка» получается бесплатно, как частный случай.

Технически Atlas — мультимодальный авторегрессионный диффузионный трансформер. Звучит как сборник модных слов, но каждое из них работает. Авторегрессионность даёт гибкость: любая задача выражается как последовательность, где за входами следуют выходы, и позволяет использовать наработки из мира LLM вроде KV-кэширования и disaggregated serving. Диффузия (модель построена на rectified flow) хорошо моделирует изображения и видео и позволяет балансировать скорость и качество числом шагов деноизинга. Трансформерная основа дружит с современным железом. Модель обучена с нуля, и World Labs заявляет, что её способности растут с вычислительным бюджетом, то есть классические законы масштабирования здесь работают.

Режиссёрское кресло вместо игрового автомата

Первая прикладная задача — генерация видео с контролем камеры. Atlas принимает от одного до шести опорных кадров и траекторию камеры как точные геометрические данные, а не как текстовую подсказку «медленно наезжает слева». На выходе — до минуты видео в разрешении 1440p, где каждый кадр соответствует заданному ракурсу.

Разница с привычными видеомоделями принципиальная. Когда вы просите обычный генератор «показать сцену с высоты птичьего полёта», вы дёргаете рычаг и надеетесь. World Labs формулирует это прямо: вы занимаете режиссёрское кресло, а не тянете ручку слот-машины. Из одного снимка робота модель строит вид сзади, дорисовывая спину, которой не было в кадре, и угадывает, что рядом с бассейном должна быть лужайка.

Команда сравнила Atlas с ведущими видеомоделями на задаче следования камерной траектории: независимые оценщики выбирали, какая модель точнее исполнила заданное движение. По данным World Labs, Atlas выигрывает, и его преимущество растёт по мере усложнения траектории. Стоит помнить, что сравнение проводил сам разработчик, а конкурентам камерный путь описывали текстом, потому что они не принимают геометрию камеры напрямую.

Реконструкция: чем меньше кадров, тем сильнее магия

Вторая задача — восстановление реальных сцен. Здесь Atlas решает проблему синтеза новых видов из разреженных снимков, над которой компьютерное зрение бьётся десятилетиями. Два или три фотографии обычно хватает для точной реконструкции, а модель способна принять и сотню кадров, если нужна максимальная точность.

Механика работы с неопределённостью элегантная: чем больше модель видит, тем меньше она фантазирует. В примере с загородным участком один снимок сада даёт корректный сад, но выдуманный дом. Добавляете фото коттеджа, и коттедж становится настоящим, а фантазия сокращается до оставшегося неохваченным угла. Третий кадр закрывает сцену целиком. В другом примере главный квад Стэнфорда собирается по кусочкам из 2–25 снимков с уровня земли, после чего модель прокладывает траектории аэросъёмки высоко над кампусом.

Важно и то, что Atlas обходит специализированные open-source модели 3D-реконструкции на стандартных бенчмарках этой задачи, хотя сам является универсальной моделью, а не узким инструментом. Обычно универсальность покупается ценой качества в каждой конкретной задаче. Здесь World Labs утверждает обратное.

На выходе можно получить не только видео, но и явную геометрию: облака точек и 3D Gaussian splats, которые рендерятся на устройстве с высокой частотой кадров. Для робототехники, игр, дизайна и VFX это критично, потому что там нужна не картинка, а манипулируемая сцена.

Почему раньше это было так сложно

Чтобы оценить скачок, стоит вспомнить, как реконструкция делалась до мировых моделей. Классический пайплайн на NeRF или 3D Gaussian Splatting требует плотного набора снимков: десятки, а лучше сотни кадров, равномерно покрывающих сцену со всех сторон. Затем под конкретную сцену обучается отдельная модель, иногда часами. Пропустил ракурс, получил дыру или артефакт. Съёмка интерьера превращалась в методичный обход с камерой по заранее продуманной сетке, а про сцену «на выходных снял, в понедельник показал» можно было забыть.

Atlas меняет уравнение в двух местах. Во-первых, вместо обучения под каждую сцену работает одна предобученная модель с общим знанием о мире: она знает, как обычно устроены сады, фасады и кампусы, и использует это знание, чтобы закрывать пробелы. Во-вторых, порог входа падает с сотни кадров до двух-трёх. Именно поэтому World Labs называет задачу синтеза видов из разреженных снимков фундаментальной проблемой компьютерного зрения: она известна десятилетиями, и сдвиг здесь ощущается каждым, кто хоть раз сканировал помещение телефоном.

Симуляция пространства-времени

Третий блок возможностей самый зрелищный. Atlas моделирует не только геометрию, но и поведение сцены во времени. Тот самый bullet time: три-пять телефонов на штативах снимают событие, модель восстанавливает сцену, а дальше кадр можно переснять с любой точки, замедлив или остановив время. Никакой студии, никакого профессионального оборудования.

Для робототехники открывается сценарий Real-to-Sim. Пространство сканируется видео с телефона (в демо World Labs хватило 24 кадров на окружение), после чего Atlas генерирует RGB и глубину, которые «увидели» бы сенсоры робота на заданном маршруте. Мир и взгляд робота на него порождаются одной моделью. Манипуляции тоже симулируются: из нескольких бытовых записей строится сцена с движением жёстких, шарнирных и деформируемых объектов, а дальше параметры можно варьировать, меняя предметы, их положение, освещение и фон. Получается конвейер разнообразных обучающих данных без физического полигона.

Та же неделя, тот же сигнал

Показательно, что Atlas вышел не в вакууме. В ту же неделю Runway показала Solaris: систему, где видео Gen 4.5 дообучено воспринимать действия пользователя как сигнал кондиционирования наравне с текстом и изображениями. Клики и перетаскивания объектов становятся входом для генерации следующего кадра: переносишь растение, и модель в реальном времени перестраивает тени. Люди помещают себя в сцену по селфи и переодевают персонажа перетаскиванием одежды.

Два независимых анонса в одну неделю рисуют одну траекторию. Видеомодели взрослеют из генераторов клипов, которые нельзя ни поправить, ни направить, в интерактивные симуляторы, где у пользователя есть рычаги управления. Контроль камеры, явная геометрия, реакция на действия: всё это шаги к тому, чтобы генеративное видео стало инструментом, а не лотереей.

Что это меняет на практике

Для кино и рекламы Atlas означает превизуализацию и эффекты без студии: пересъёмка сцены с несуществующего ракурса, bullet time из рюкзака, виртуальные локации из пары фотографий. Для робототехники — дешёвое масштабирование обучающих сред: отсканировал склад телефоном, получил симуляцию с вариациями. Для игр и дизайна — быстрый путь от референсов к navigable-пространствам с экспортом в Gaussian splats.

Есть и обратная сторона. Модель, которая уверенно дорисовывает невидимые части реального мира, рано или поздно дорисует их в судебной экспертизе, страховом деле или новостном сюжете. Граница между реконструкцией и фантазией управляется числом входных кадров, но со стороны зрителя отличить «увиденное» от «домысленного» будет всё труднее.

Часто задаваемые вопросы

Чем Atlas отличается от обычных видеогенераторов вроде Sora или Gen 4?

Видеогенераторы принимают текст или картинку и выдают ролик. Atlas дополнительно принимает геометрию камер и карты глубины, строит согласованную 3D-сцену и умеет выдавать явную геометрию (облака точек, Gaussian splats), а не только плоское видео.

Сколько фотографий нужно для реконструкции места?

По данным World Labs, точная реконструкция обычно достигается с двух-трёх снимков. Один кадр тоже работает, но невидимые части сцены модель домыслит. Максимальная точность требует десятков и сотен кадров, Atlas принимает больше сотни.

Когда Atlas станет доступен?

Сейчас модель в раннем доступе для отобранных партнёров, публичной даты релиза нет. Технология ляжет в основу будущих версий Marble, продукта World Labs для генерации 3D-окружений.

Правда ли, что Atlas лучше специализированных моделей 3D-реконструкции?

World Labs заявляет превосходство над лучшими открытыми моделями реконструкции на стандартных бенчмарках с воспроизведёнными базовыми результатами. Независимой проверки пока не было, к цифрам разработчика стоит относиться с осторожностью.

Итог

Atlas — самый цельный на сегодня ответ на вопрос, что придёт после видеогенераторов. Модель объединяет генерацию, реконструкцию и симуляцию в одной архитектуре, где пространство является первоклассным гражданином, а камера — точным инструментом, а не пожеланием в промпте. Одновременный выход Runway Solaris подсказывает, что это не частная инициатива одной лаборатории, а поворот всей индустрии: от роликов, которые нельзя контролировать, к мирам, в которых можно работать. Следите за ранним доступом к Marble: именно там Atlas впервые окажется в руках практиков, и там же станет ясно, насколько демо соответствуют реальности.

← Все записи