Wat3R: как ИИ научился видеть под водой без единой подводной метки
Вода поглощает свет иначе, чем воздух. Красный спектр затухает уже на глубине нескольких метров, синий проникает дальше, а взвешенные частицы превращают каждый кадр в мутное зеленоватое месиво. Для компьютера это означает, что привычные модели 3D-реконструкции — натренированные на миллионах чётких наземных снимков с точными метками глубины — под водой буквально слепнут. Исследователи из команды LSXI предложили решение, которое выглядит почти как магия: взять модель, обученную на суше, и заставить её работать под водой, ни разу не показав размеченных подводных данных.
В чём проблема подводной геометрии
Восстановление трёхмерной структуры по набору изображений — задача классическая. Камерные позы, карты глубины, облака точек: всё это стандартный набор для автономных роботов, картографов и археологов. На суше задача в значительной степени решена — модели вроде VGGT, DUSt3R и Fast3r восстанавливают геометрию за один проход через нейросеть, без итеративной оптимизации. Они обучены на гигантских датасетах с плотными 3D-аннотациями: для каждого пикселя известна глубина, для каждого кадра — точная позиция камеры.
Под водой всё иначе. Свет рассеивается и поглощается неравномерно: разные длины волн деградируют с разной скоростью, причём деградация зависит от конкретного водоёма. В Средиземном море одна мутность, в тропическом рифе — другая, в карьерном озере — третья. Универсальной «подводной физики света» не существует — каждый корпус данных требует индивидуальной калибровки. Отсюда практическая проблема: взять и разметить подводные кадры с метровой точностью практически невозможно. Ни LiDAR под водой не работает в привычном режиме, ни_STRUCTURE__from_motion не даёт стабильных результатов на мутных последовательностях.
Исследователи столкнулись с дилеммой: существующие датасеты (SeaThru, SQUID, FLSea) содержат от 4 до 12 сцен, и каждый предоставляет либо аннотации глубины, либо позы камер — но никогда и то, и другое одновременно. Этого недостаточно, чтобы тренировать полноценную feed-forward модель. Именно поэтому прямой перенос VGGT под воду даёт плохие результаты: domain shift между наземными и подводными изображениями слишком велик.
Архитектура Wat3R: учитель, ученик и перекрёстная согласованность
Wat3R — это фреймворк кросс-доменного полу-supervised обучения, построенный вокруг идеи Mean Teacher. Суть в том, что одна и та же сеть играет две роли. Teacher-копия поддерживает экспоненциально скользящее среднее весов student-копии и генерирует псевдо-метки: карты глубины, параметры камеры, 3D-point maps. Student учится воспроизводить эти предсказания на реальных подводных кадрах, которые никакой разметки не имеют.
Первый этап — синтетическая адаптация. Берётся оригинальный тренировочный набор VGGT (наземные сцены с полной 3D-разметкой), и на каждом кадре имитируются подводные искажения: цветовое поглощение, scattering, зависящее от расстояния, view-dependent деградация. Получается пара «наземный оригинал с метками» и «синтетический подводный» — модель начинает видеть подводную физику, продолжая учиться на настоящих аннотациях.
Второй этап — реальная домен-адаптация. Сюда вступают настоящие подводные видеозаписи без единой метки. Student обрабатывает кадры, teacher генерирует псевдо-метки, и loss минимизирует расхождение между ними. Ключевая идея — cross-view consistency loss. Вода размывает информацию в каждом отдельном кадре, но геометрия сцены одна и та же с разных ракурсов. Если два кадра смотрят на один и тот же коралловый риф с разных позиций, их восстановленные облака точек должны совпадать в общих областях. Этот сигнал и компенсирует потерю информации в отдельном view.
Технические детали обучения конкретны: четыре RTX 4090, 19 200 шагов, линейный warm-up на первые 1000 шагов, learning rate 5×10⁻⁶ для ViT-бэклона и 5×10⁻⁵ для heads. Смешанная точность bfloat16 и gradient checkpointing экономят память. Первые 6400 шагов модель учится только на размеченных синтетических данных, затем вес unsupervised loss плавно растёт до 0.5 к шагу 12 800. На каждом шаге сэмплируются от 2 до 12 изображений с максимальным размером стороны 518 пикселей. Соотношение неразмеченных и размеченных — 3:1.
Water3D: первый полноценный бенчмарк
Параллельно с методом авторы собрали датасет Water3D — 42 сцены с разнообразными условиями: прозрачные тропические воды, мутные пресноводные озёра, прибрежные зоны с взвесью. В отличие от предшественников, Water3D предоставляет одновременно и depth annotations, и camera poses, что позволяет оценивать модели комплексно. Для сравнения: SeaThru даёт 5 сцен только с глубиной, FLSea Stereo — 5 сцен с глубиной, SeaThru-NeRF — 4 сцены только с позами. Water3D покрывает все задачи одновременно.
На этом бенчмарке Wat3R сравнивали с пятью методами: WaterSplatting (3DV'25), Fast3r (CVPR'25), MapAnything (3DV'26), π³ (ICLR'26), DA3 (ICLR'26) — и базовой VGGT (CVPR'25). Два протокола оценки: Shuffle 10-view (десять кадров в случайном порядке) и Full Subsequence (100 кадров подряд, что ближе к реальной видеосъёмке).
Результаты на SeaThru-бенчмарке в Shuffle-режиме: относительная ошибка Wat3R — 0.167 против 0.190 у VGGT (улучшение 12.1%), δ₁ — 0.946 против 0.891 (+6.2%), RMSE — 0.290 против 0.380 (+23.7%). На FLSea Stereo улучшение ещё заметнее: RMSE падает с 0.760 до 0.720, а log₁₀ — с 0.059 до 0.048 (+18.6%). В режиме Full Subsequence (100 кадров) картина аналогичная: от 11.8% до 21.2% улучшения по разным метрикам. Примечательно, что двухстадийные пайплайны — где кадр сначала улучшают методом подводной коррекции, а потом подают в VGGT — показывают худшие результаты, чем прямой Wat3R. Это означает, что предварительное «улучшение» картинки скорее ломает геометрические сигналы, чем помогает.
Физика подводного света: почему domain shift неизбежен
Прежде чем говорить об архитектуре, стоит понять, что именно ломается при переносе модели под воду. В атмосфере свет практически не поглощается на расстояниях, типичных для компьютерного зрения — даже километры между камерой и объектом не меняют радикально цветовую температуру. Под водой всё иначе: коэффициент поглощения для красного света (~650 нм) в десять раз выше, чем для синего (~450 нм). Уже на глубине 5 метров красный канал практически исчезает, а на 20 метрах вся сцена становится монохромно-синей. Добавьте к этому forward scattering — взвешенные частицы добавляют к каждому пикселю «вуаль» засветки, интенсивность которой растёт с расстоянием до объекта. В результате один и тот же коралл на расстоянии 1 метра и 5 метров выглядит как объекты из совершенно разных доменов.
Для наземной модели VGGT, обученной на CO3D, RealEstate10K и других датасетах с чёткими паттернами яркости и цвета, такая деградация означает катастрофическую потерю сигналов. Текстура, которая на суше однозначно кодирует расстояние (через perspiration, атмосферную перспективу), под водой искажена нелинейно и view-dependent. Именно поэтому прямой inference VGGT на подводных кадрах даёт relative error 0.190 и RMSE 0.380 — цифры, неприемлемые для навигации робота.
Почему это важно для подводных роботов
Практические приложения — навигация подводных дронов, картографирование морского дна, подводная археология, мониторинг коралловых рифов — всё это требует реконструкции в реальном времени без возврата на поверхность для обработки. Раньше для каждого нового водоёма модель пришлось бы переобучать с ручной разметкой, что занимает недели полевых работ. Wat3R позволяет взять предобученную модель, загрузить неразмеченное видео с нового водоёма — и получить feed-forward реконструкцию за один проход.
Кросс-view consistency особенно ценна для автономных систем. Подводный робот часто видит одну и ту же структуру с разных ракурсов при обходе: именно эта избыточность и используется для компенсации мутности. Алгоритм не нуждается в идеальных кадрах — ему нужна геометрия, согласованная между ними. Важно, что даже при значительной деградации отдельных кадров (например, когда робот проплывает через облако взвеси), система сохраняет стабильность благодаря тому, что другие views из той же последовательности остаются чистыми.
Бесплатный код и датасет (https://github.com/LSXI7/Wat3R) означают, что сообщество может строить поверх Wat3R: добавлять новые типы деградаций, интегрировать с SLAM-системами, адаптировать для конкретных типов водоёмов.
Часто задаваемые вопросы
Почему не использовать обычный image enhancement перед 3D-реконструкцией?
Эксперименты показывают, что двухстадийные пайплайны (сначала улучшение кадра, потом VGGT) проигрывают端到нному подходу Wat3R. Методы enhancement оптимизируют визуальное качество для человеческого глаза, но разрушают тонкие геометрические сигналы — градиенты яркости, паттерны текстуры, которые модель использует для оценки глубины.
Работает ли Wat3R для единичных фотографий, а не видео?
Да, монокулярная оценка глубины — одна из четырёх задач, на которых тестировалась модель. Однако точность на одном кадре ниже, чем на мульти-view последовательности: cross-view consistency требует минимум двух ракурсов для максимальной эффективности. На практике подводный дрон почти всегда снимает видео, поэтому этот режим — основной для реальных применений.
Можно ли применить подход за пределами подводной среды?
Принцип Mean Teacher с cross-view consistency универсален. Любая среда с domain shift и обилием неразмеченного видео — ночные сцены, туман, медицинские эндоскопические кадры — потенциально выигрывает от аналогичной стратегии адаптации без целевых аннотаций.
Ограничения и направления развития
Wat3R не решает проблему полностью и открывает несколько направлений для будущих исследований. Модель всё ещё требует значительного объёма неразмеченного подводного видео для второго этапа обучения — нельзя просто «скачать и применить» к единственному кадру из нового водоёма. Training pipeline из 19 200 шагов на четырёх RTX 4090 — это заметные вычислительные затраты, хотя и однократные для каждого типа водоёма. Кроме того, synthetic underwater degradation на первом этапе — это всё же симуляция; разрыв между искусственно искажёнными наземными кадрами и реальными подводными съёмками остаётся, и teacher-student парадигма лишь частично его компенсирует.
Будущее направление — интеграция с подводными SLAM-системами в реальном времени. Сейчас Wat3R работает в feed-forward режиме на записанных последовательностях, но для автономного подводного робота критична online-обработка: каждый новый кадр должен обновлять карту без перемотки всей последовательности. Объединение cross-view consistency с sliding-window inference могло бы дать полноценный подводный perception stack.
Итог
Wat3R показывает, что для переноса мощных vision-моделей в экзотические домены не обязательно собирать дорогие размеченные датасеты. Полу-supervised подход с teacher-student архитектурой и cross-view consistency позволяет модели «додумывать» геометрию там, где вода стирает информацию, используя только избыточность мульти-view съёмки. 12–24% улучшения над SOTA на четырёх задачах при полном отсутствии подводных 3D-меток во время обучения — это не просто технический результат. Это архитектурный паттерн, который будет повторяться по мере того, как ИИ начнёт осваивать среды, где разметка невозможна в принципе.