Сегментация посевов со спутников: датасет важнее архитектуры

Сегментация посевов со спутников: датасет важнее архитектуры

Европейские субсидии фермерам всё чаще проверяют из космоса. Sentinel-2 снимает одни и те же поля каждые несколько дней, а сегментация посевов по этим сериям определяет, что именно растёт на каждом участке: пшеница, кукуруза, рапс или луг. Ошибка в десять метров на границе поля или перепутанная культура превращаются в неверную выплату, поэтому требования к точности здесь особые.

29 сентября в arXiv вышла работа группы из Университета Суонси: Джозеф Меткалф, Сара Шарифзаде и Фабио Караффини представили PAtteRNS, нейросеть для сегментации посевов по временным сериям спутниковых снимков. В работе три сюжета: новая схема внимания, скромная свёрточная надстройка, без которой качество границ падает, и жёсткий вывод про датасеты. Последний важнее первых двух.

Что такое сегментация посевов

Сегментация посевов означает попиксельную классификацию: каждая точка снимка относится к одной из культур. Модель получает не один кадр, а временную серию (SITS, Satellite Image Time Series), то есть четырёхмерный тензор: время, спектр, высота, ширина. Временная ось хранит фенологию, цикл роста культуры, а спектральные каналы различают виды по тому, как они отражают свет. Данные для таких задач открыты: Sentinel-2 делает повторные снимки с периодом меньше семи дней и даёт больше 50 наблюдений в год.

Учёные взяли два датасета: PASTIS по французским полям (61 снимок за 406 дней, 10 спектральных каналов, 18 культур) и MTLCC по Баварии (45 снимков за 341 день, 13 каналов, 17 культур). Оба построены на снимках Sentinel-2 с разрешением 10 метров и открытой правительственной разметке участков.

Почему это сложная задача

Различать культуры по спектру и во времени модели более-менее научились. Хуже всего дела с границами: соседние поля часто заняты одной и той же культурой, а разделяет их забор или межа шириной меньше пикселя. Алгоритм уверенно предсказывает культуру внутри поля, но «протекает» на края соседних участков. А для системы субсидий именно границы и есть самое важное: участок без чёткой границы нельзя проверить.

Три оси внимания: как устроена PAtteRNS

За основу авторы взяли TSViT, актуальную SOTA-модель, которая факторизует внимание: сначала обрабатывает временную ось, потом пространственную. Токенизация стандартная для трансформеров: тайл режется на неперекрывающиеся патчи, каждый патч проецируется в эмбеддинг, к ним добавляются обучаемые cls-токены по числу классов. PAtteRNS добавляет третью ось, спектральную, и здесь начинается инженерия.

Наивный путь, поставить три трансформера друг за другом, упирается в квадратичную сложность внимания: промежуточные представления раздуваются, и число операций растёт примерно в пять раз. Авторы пошли другим путём: две параллельные ветки получают одни и те же патчи, но по-разному их сплющивают. Временная ветка сохраняет ось дат съёмки, спектральная сохраняет ось каналов. Каждая выдаёт свои cls-токены, после чего их надо слить.

Слияние это отдельная деталь: исследователи перебрали четыре варианта кросс-внимания и остановились на схеме, где спектральные токены служат запросами к временным. В абляциях этот вариант обошёл и обратное направление, и полную двустороннюю связь. Дальше объединённое представление уходит в пространственный трансформер, который связывает патчи между собой, и на выходе восстанавливается карта классов размером с исходный тайл.

Финальный штрих: свёрточная надстройка CRH. Выход пространственного трансформера проходит через три свёртки (две 3×3 и одну 1×1) и возвращается в виде поправки, которая складывается с основными логитами. Свёртки не заменяют внимание, а дошлифовывают его результат. В мире, где принято строить чисто трансформерные архитектуры, это выглядит почти ретроградством. И оно работает.

Четыре метрики и одна новая

Качество модели измеряют сразу четырьмя способами. Overall Accuracy (OA) считает долю верных пикселей. Mean IoU и Dice оценивают перекрытие предсказанных и эталонных масок по классам. Но первые три метрики не видят главной слабости сегментации, качества границ: модель может угадать культуру внутри поля и всё равно «испачкать» соседние участки.

Поэтому авторы применили Boundary IoU, метрику, которая сравнивает эталон и предсказание только в полосе вдоль границ классов. Ширина полосы задана как 5% диагонали тайла, то есть 2 пикселя для тайла 24×24, 3 для 48×48 и 9 для 128×128. Для задачи сегментации посевов эту метрику, по словам авторов, используют впервые, и она сразу показывает разницу между моделями, которую обычные метрики прячут.

Результаты: границы, скорость и разгадка чужого превосходства

На датасете MTLCC при патче 2×2 новая модель берёт 92,4% OA, mIoU 0,786 и mBIoU 0,589 на тайлах 48×48. На тайлах 24×24: 91,9%, 0,801 и 0,576. Для сравнения, TSViT там же набирает 0,757 и 0,769 mIoU при mBIoU 0,566 и 0,554, а свёрточная UTAE, главный конкурент, 0,782 и 0,790 mIoU при 0,550 и 0,542. По mBIoU PAtteRNS лидирует с отрывом в среднем 4,4%, а в лучших конфигурациях обходит UTAE на 6,3%.

На PASTIS метрики скромнее, и это ещё пригодится ниже: mIoU 0,646 и 0,659, Dice 0,768 и 0,779, mBIoU 0,436 и 0,393 при патче 2×2.

Отдельная история касается OA. По точности вперёд иногда выходит UTAE (92,6% против 92,4% на MTLCC-48), и авторы разобрали, откуда берётся этот отрыв. Ответ: фон. Класс Background занимает 43,2% пикселей на MTLCC-24 и 44,7% на PASTIS-24, и UTAE точнее размечает именно его, выигрывая 1,2 и 2,6 процентного пункта. В пересчёте на общий балл фон приносит ей плюс 0,52 и плюс 1,16 пункта, то есть больше, чем весь её отрыв по OA. Реальное преимущество в сегментации культур при этом у PAtteRNS: она обходит UTAE по доле верно найденных пикселей для 13 классов из 18 на MTLCC-24 и для 15 из 19 на PASTIS-24.

По скорости новая модель не проигрывает. При патче 4×4 эпоха обучения занимает у неё 40,3 секунды против 59 у TSViT и 98 у UTAE, инференс 13,5 мс на батч. При патче 2×2 она обгоняет TSViT и по инференсу: 37,9 против 56,1 мс. Правда, лучшая эпоха у PAtteRNS наступает в среднем на 140-й из 150, то есть модель упирается в лимит обучения, и авторы намекают, что дай ей больше эпох, показатели выросли бы ещё. Показательная деталь: переобучив UTAE по 150 эпох вместо 100, они получили OA 83,8% вместо заявленных в оригинальной статье 83,2% и mIoU 0,650 вместо 0,631.

Что показали абляции

Из трёх веток самая важная оказалась временная. Спектральная добавляет немного, но стабильно: включение третьего трансформера поднимает OA на MTLCC-48 с 92,0 до 92,1%, а mIoU с 0,772 до 0,774. Существеннее другое: пространственный трансформер вместе с CRH не даёт разваливаться границам, добавляя 13,3% mBIoU на MTLCC-48 и 15,3% на PASTIS-128. Сама свёрточная надстройка даёт плюс 2,7% mBIoU поверх полной модели, а без пространственного трансформера целых 13,5%. Вывод простой: свёртки в 2026 году всё ещё лучший инструмент локальной дошлифовки.

Размер патча тоже влияет, только не на то, на что ждёшь. Уменьшение с 4×4 до 2×2 поднимает mBIoU на 5,7%, зато почти удваивает время инференса. Размер эмбеддинга 256 против 128 утраивает параметры ради долей процента, поэтому оставили 128.

Главный вывод: датасет важнее архитектуры

Вторая половина названия статьи, «Attention to Dataset Disparity», обещает не меньше, чем первая. И не обманывает. Авторы прошлись по разметке обоих датасетов и нашли три системные проблемы.

Первая: таксономические агрегаты, то есть один класс на несколько разных культур. В PASTIS четыре таких класса: фрукты, овощи и цветы, бобовые кормовые, сад и смешанные зерновые. На них приходится 11,2% размеченных участков. В MTLCC агрегат всего один, озимая пшеница, но он охватывает 24% участков и объединяет мягкую и твёрдую пшеницу. Модель не может научиться различать то, что в разметке названо одним словом.

Вторая: неоднородные классы. Луг в разметке это смесь разных трав, а виноградник и сад соседствуют с межрядовой травой. Такие классы законны с точки зрения таксономии, но их внутренняя неоднородность размывает границы. В PASTIS неоднородными оказались 60% участков (25,2% пикселей), в MTLCC 37,6% участков (17,9% пикселей).

Третья: сезонные агрегаты, когда в один класс сводят яровые, озимые и летние варианты одной культуры. В MTLCC так поступили с рапсом.

Цена этих решений измерима. Средняя полнота (recall) по таксономическим агрегатам в PASTIS-24 составляет 60,6% у PAtteRNS, 54,6% у TSViT и 52,5% у UTAE. Для остальных классов те же модели показывают 83,4%, 81,0% и 80,8%. Разница в 20 с лишним процентных пунктов создана не архитектурой, а тем, как составители датасета выбрали классы.

Дальше конкретика из матриц ошибок. В MTLCC примерно половину пикселей луга все модели относят к фону. Агрегат «озимая пшеница» путается с полбой и тритикале, и это биологически естественно: они родственники. Сад в PASTIS уходит в фон из-за травы между деревьями, смешанные зерновые рассыпаются по другим злакам. Забавная деталь: единственный сезонный агрегат, рапс, оказался лучшим классом MTLCC у всех трёх моделей. Видимо, его фенология настолько характерна, что даже объединение сезонных вариантов не мешает.

Общий вывод авторов звучит неожиданно для статьи про архитектуру: кривые таксономии и агрегация классов вредят точности сильнее, чем выбор модели. Аккуратно собранный датасет может дать больше, чем новая архитектура.

Ловушка размера тайла

Второй датасетный сюрприз касается размера тайлов. Кажется, что это техническая деталь: ну режем снимки на куски 24×24 или 128×128, какая разница. Разница огромная. При переходе с MTLCC-48 на MTLCC-24 у всех моделей падает OA, но растут mIoU и Dice. UTAE на уменьшенных тайлах PASTIS теряет по всем трём метрикам сразу. А mBIoU в принципе нельзя сравнивать между разными размерами, потому что ширина полосы у границ задана в пикселях, а не в метрах.

Отсюда практическое правило: результаты моделей, обученных на тайлах разного размера, нельзя ставить в один ряд. Авторы подчёркивают, что раньше никто системно не изучал этот эффект, а он искажает сравнения во всей области. Направление будущих работ они видят в динамическом размере тайла: обучение на одном, инференс на другом, с обратной сборкой.

Заодно нашлась менее очевидная асимметрия между датасетами. В PASTIS класс Void маскируется при обучении, и модели получают теоретическое преимущество: проблемные участки просто исчезают из оценки. В MTLCC такой роскоши нет, так что и междатасетные сравнения хрупки.

Что это значит на практике

Для команд, которые строят агротех-продукты на Sentinel-2, выводы работы складываются в последовательность шагов. Сначала аудит разметки: если в датасете есть агрегаты вроде «фрукты, овощи и цветы», потолок точности ограничен самими данными. Потом выбор тайла: его нужно фиксировать сознательно и не сравнивать свои метрики с чужими, если тайлы различались. Затем метрики: стоит добавить Boundary IoU, потому что именно границы полей определяют деньги в субсидийных пайплайнах. И только после этого архитектура: гибрид внимания со свёрточной доводкой по-прежнему выигрывает у чисто трансформерных схем.

Код и модели PAtteRNS авторы выложили на GitHub, оба датасета открыты, а обучение прошло на трёх конфигурациях железа: настольная RTX 4080, серверная RTX A6000 и узлы с A100 в суперкомпьютерном центре Уэльса. Повторить эксперимент на своих данных вполне реально.

Почему метрики нельзя сравнивать между тайлами разного размера?

Размер тайла меняет то, что видит модель: контекст вокруг поля, баланс классов и даже ширину полосы у Boundary IoU, которая задана в пикселях. В работе показано, что один и тот же алгоритм на тайлах 48×48 и 24×24 выдаёт разные результаты, иногда в противоположные стороны. Корректное сравнение возможно только внутри одного размера.

Что такое Boundary IoU и зачем она нужна?

Это метрика, которая оценивает совпадение предсказания с эталоном только в полосе вдоль границ классов, а не по всему изображению. Обычные OA и mIoU не замечают, что модель «протекает» на края соседних участков. Для сегментации посевов это критично: неточная граница поля означает неверную проверку субсидии.

Чем PAtteRNS отличается от других моделей для спутниковых снимков?

Она первой применяет факторизованное внимание сразу к трём осям данных: временной, спектральной и пространственной. Временная и спектральная ветки работают параллельно, что снижает вычислительную стоимость примерно в пять раз по сравнению с последовательной схемой, а свёрточная надстройка поверх трансформеров улучшает качество границ полей.

Итог

PAtteRNS показывает, что сегментация посевов со спутников ещё не исчерпала архитектурных идей: параллельные ветки внимания по осям данных плюс свёрточная доводка дают лучший в своём классе результат по качеству границ полей. Но самое ценное в работе это не модель, а измеренная цена датасетных решений. Таксономические агрегаты, неоднородные классы и несовместимые размеры тайлов снижают точность сильнее, чем любая архитектурная замена её повышает. Если вы строите системы мониторинга полей, начните с разметки. Она важнее архитектуры.

← Все записи