VLM за 8 лет: от хуже худшего человека до уровня топ-описателей
В 2017 году лучшая модель описания сцен видела на фотографии двух людей и писала: «Два человека стоят рядом». Человек на том же изображении писал: «Отец утешает дочь после проигранного матча». Разница не в грамматике — в понимании того, что происходит между людьми. Восемь лет спустя эта разница почти исчезла, но не полностью.
Исследователи из Калифорнийского университета в Санта-Барбаре (Shravan Murlidaran и Miguel P. Eckstein) опубликовали работу, которая впервые систематически отслеживает, как менялись ошибки vision-language моделей на протяжении целого десятилетия — с 2017 по 2025 год. Не просто точность на простых картинках, а конкретные типы когнитивных сбоев: что модель не заметила, что перепутала, что придумала и куда смотрела.
Зачем понадобился новый датасет
Проблема evaluations в компьютерном зрении известна давно: модели тестируют на том, что им легко. Датасет MS-COCO, ставший стандартом для оценки описания сцен с 2014 года, содержит фотографии кухонь, пляжей и домашних животных — сцены, которые не требуют понимания социальных взаимодействий. На таких изображениях даже ранние модели показывали результаты, близкие к человеческим, создавая иллюзию, что задача почти решена.
Murlidaran и Eckstein создали датасет Complex Social Behavior (CSB) — 100 кадров из коммерческих фильмов, изображающих сложные социальные взаимодействия: конфликты, утешение, переговоры, групповую динамику. Каждое изображение требует от описателя не просто перечислить объекты, а понять, что происходит между людьми. Исследователи отобрали кадры так, чтобы по ним можно было сформулировать вопросы о социальных взаимодействиях — это автоматически отсеяло «простые» сцены вроде прогулки по парку.
Для сравнения они взяли 100 случайных изображений из MS-COCO и протестировали все модели на обоих наборах. Результат показал, что оценка на MS-COCO даёт совершенно иную картину прогресса, чем оценка на CSB — и CSB куда более чувствительна к реальным улучшениям.
Девять моделей, двадцать описаний, одна метрика
В исследование вошли девять моделей, охватывающих всю эволюцию подхода: четыре pre-MLLM (UDC 2017 года, M2M и OSCAR 2020 года, OFA 2022 года) и пять современных MLLM (GPT-4, Gemini, GPT-4o1, GPT-5.1 и Gemini3). Pre-MLLM использовали комбинацию ResNet-101 для извлечения визуальных признаков и либо LSTM, либо Transformer-декодер для генерации текста. MLLM построены на Transformer-архитектуре и обучены на массивных парах изображение-текст с применением reinforcement learning from human feedback.
Для каждого из 200 изображений собрали 20 описаний от обычных людей через Amazon Mechanical Turk. Ещё 50 участников ранжировали эти описания по качеству. Лучшее описание становилось «золотым стандартом», четыре худших — нижней границей человеческой точности. Модели оценивали через косинусное сходство эмбеддингов (использовали Gemini-SI и GPT-SI), которое, как показали авторы, коррелирует с человеческими оценками сильнее, чем среднее согласие между самими людьми.
Дополнительно 15 участников проходили тестирование с айтрекером — исследователи записывали, куда именно смотрят люди при описании сцены, и сравнивали это с зонами, на которые опирались модели через GradCAM-карты активации.
Результаты: восемь лет прогресса в одной таблице
На простых сценах MS-COCO все девять моделей показали относительно высокие результаты, а разница между поколениями была невелика. Это подтверждает давнюю критику: датасет перестаёт различать модели, потому что задачи слишком просты.
На CSB картина радикально отличается. Pre-MLLM (2017–2022) набрали значительно ниже, чем даже четыре худших человеческих описания из двадцати. Их результаты находились за пределами нормального человеческого разброса — то есть даже самый плохой описатель-человек справлялся лучше, чем передовая модель своей эпохи.
Современные MLLM (GPT-4, Gemini, GPT-4o1, GPT-5.1, Gemini3) достигли уровня, сопоставимого с четырьмя лучшими человеческими описаниями. При этом разрыв в качестве описания между простыми сценами MS-COCO и сложными CSB, который у pre-MLLM составлял десятки процентов, у MLLM практически исчез. Модели научились одинаково хорошо описывать и кухню, и драму за обеденным столом.
Пять типов ошибок: какие исчезли, какой остался
Авторы классифицировали ошибки моделей на пять типов и проследили, как каждый тип менялся от поколения к поколению.
Ошибки детекции — модель не обнаружила объект, присутствующий на сцене. В 2017 году модели регулярно пропускали второстепенных персонажей, предметы на заднем плане, жесты. У MLLM этот тип ошибок стал крайне редким — архитектурные улучшения в attention-механизмах и масштабирование данных практически решили проблему.
Ошибки распознавания — модель увидела объект, но неправильно его идентифицировала. Классический пример pre-MLLM: «человек держит телефон», хотя на самом деле это пульт от телевизора. Этот тип тоже сократился почти до нуля у современных моделей.
Галлюцинации — модель описала объект, которого на изображении вообще нет. Ранние модели часто «видели» животных, транспорт, инструменты, которых не было на сцене, достраивая контекст по шаблонам обучения. MLLM практически перестали галлюцинировать объекты — вероятно, благодаря RLHF и масштабному контrastivному обучению.
Ошибки понимания сцены — модель правильно идентифицировала все объекты, но не поняла, что между ними происходит. Два человека рядом — не «разговаривают», а «ссорятся». Женщина с поднятой рукой — не «приветствует», а «останавливает такси». Этот тип ошибок показал наиболее драматичное сокращение: pre-MLLM регулярно проваливали социальное понимание, MLLM справляются с ним на уровне лучших человеческих описателей.
Пространственная зависимость — единственный тип ошибок, который MLLM практически не устранили. Айтрекер показал, что люди при описании социальных взаимодействий фокусируются на лицах и верхней части тела участников. Модели же опираются на другие области изображения — фоновые объекты, нижние части сцены, периферийные элементы. Описание получается правильным, но модель приходит к нему через другой визуальный путь. Это значит, что модели уязвимы к adversarial-примерам именно в сложных социальных сценах: достаточно изменить фон или периферийный объект, чтобы описание изменилось.
Почему пространственная зависимость — это не просто техническая деталь
Представьте систему видеонаблюдения с MLLM, которая описывает происходящее в реальном времени. Модель правильно определяет: «Двое мужчин обсуждают контракт». Но она пришла к этому выводу, опираясь на документ в руках одного из них, а не на выражение их лиц. Если заменить документ на меню ресторана, описание может измениться на «Двое мужчин выбирают блюда» — хотя социальное взаимодействие (переговоры) осталось прежним.
Это не теоретическая проблема. Для приложений автономного вождения, медицинской диагностики по снимкам, видеомодерации контента пространственная зависимость означает, что модели могут быть хрупкими именно в тех сценариях, где важна надёжность. Они дают правильный ответ по неправильным причинам — и это не обнаруживается стандартными метриками точности.
Авторы отмечают, что detection, recognition и hallucination errors оказывают наибольшее влияние на итоговую точность описания — но именно spatial dependence error остаётся «слепым пятном», которое не ловят benchmarks.
Методологически исследование использует bootstrap-ресэмплинг для оценки вариабельности результатов из-за ограниченного размера выборки (100 изображений на датасет). Это означает, что авторы не просто усредняют точность — они показывают доверительные интервалы и статистическую значимость различий между моделями и человеческими описателями. Такая строгость редкость для работ по оценке VLM, где часто сравнивают средние значения без оценки надёжности.
Что это значит для индустрии
Исследование поднимает несколько неудобных вопросов о том, как мы оцениваем прогресс в мультимодальном ИИ.
Во-первых, benchmarks вроде MS-COCO создают ложное ощущение, что задача описания сцен решена. Модели действительно достигли «человеческого уровня» на простых изображениях — но этот уровень не распространяется на сцены, требующие социального понимания. Переход к более сложным датасетам вроде CSB может перевернуть представление о том, какие архитектуры действительно продвинуты.
Во-вторых, пространственная зависимость — проблема, которую нельзя решить простым масштабированием данных. Модели видят миллионы изображений, но продолжают опираться на другие области, чем люди. Это указывает на фундаментальное различие в визуальной стратегии, а не на нехватку обучающих примеров. Возможно, решение потребует явного включения человеческих паттернов внимания в процесс обучения — через айтрекер-данные как supervisory signal.
В-третьих, для прикладных систем это означает, что тестирование на простых сценах недостаточно. Команда, развёртывающая MLLM для описания видеозвонков, должна тестировать её на кадрах с переговорами, конфликтами, невербальной коммуникацией — а не на фотографиях из MS-COCO.
Разработчики датасетов уже движутся в этом направлении: CSB — не единственный новый benchmark, появляющийся в 2025–2026 годах. Но исследование UCSB впервые показывает, что именно социальные взаимодействия остаются водоразделом между моделями разных поколений — и что именно здесь прячется последняя систематическая ошибка MLLM.
Авторы подчёркивают, что их работа — это не просто оценка точности, а анализ того, как модели приходят к правильным ответам. Два описания могут быть семантически идентичны, но если одно основано на распознавании лиц и жестов, а другое — на фоновых объектах, это принципиально разные системы. Для разработчиков это означает необходимость включать айтрекер-данные и GradCAM-анализ в стандартный pipeline тестирования, а не полагаться только на текстовые метрики.
Часто задаваемые вопросы
Чем CSB отличается от других датасетов для оценки VLM?
Большинство датасетов (MS-COCO, NoCaps, TextCaps) фокусируются на описании объектов и их расположения. CSB специально создан для оценки понимания социальных взаимодействий: кадры отобраны так, чтобы описать сцену было невозможно без понимания отношений между людьми, а не просто перечисления видимых объектов.
Почему пространственная зависимость не исчезает с масштабированием?
Модели обучаются на парах изображение-текст и учатся предсказывать правильные описания. Если описание можно вывести из фона или периферийных объектов так же надёжно, как из лиц — модель использует любой доступный сигнал. Масштабирование данных не меняет эту стратегию, потому что обе стратегии одинаково эффективны на обучающей выборке.
Какие модели показали лучший результат на CSB?
Исследование показало, что GPT-4o1, GPT-5.1 и Gemini3 достигли уровня, сопоставимого с лучшими человеческими описаниями. Различия между этими тремя моделями были статистически незначимыми — все они практически устранили разрыв между простыми и сложными сценами.
Влияет ли пространственная зависимость на практические применения?
Да. Системы, полагающиеся на визуальное описание (автоматическая видеомодерация, помощь слабовидящим, автономные агенты), уязвимы к изменениям в нерелевантных областях изображения. Adversarial-изменение фона может изменить описание социального взаимодействия, даже если сами участники не изменились.
Новое исследование показывает, что vision-language модели прошли путь от уровня хуже худшего человека до уровня лучших описателей за восемь лет. Но одна ошибка — зависимость от других визуальных областей — остаётся, и она не обнаруживается стандартными benchmarks. Для инженеров это сигнал: тестирование на сложных социальных сценах — не академическая роскошь, а необходимость для надёжных систем. Для исследователей — вызов: как научить модели «смотреть туда же», куда смотрят люди, когда описывают происходящее между людьми.