OmniAssistBench: видеоассистенты на омни-моделях не справляются
Омни-модальные модели уже умеют одновременно смотреть видео, слушать звук и отвечать голосом. Но насколько хорошо они справляются с ролью живого ассистента, который ведёт пользователя к цели шаг за шагом? Новый бенчмарк OmniAssistBench даёт трезвый ответ: лучшая проприетарная модель, Gemini-3-Pro, набирает 66.4 балла из 100, а лучшая открытая, Qwen3-Omni-Instruct, всего 51.2. До надёжного помощника, которому можно доверить навигацию по городу или помощь слабовидящему человеку, пока далеко.
Работа опубликована на arXiv (2608.21360) и закрывает пробел, который индустрия обходила стороной. Существующие видео-бенчмарки проверяют пассивное понимание: модель смотрит ролик и отвечает на вопросы. Но реальный ассистент работает иначе: его ответ меняет поведение пользователя, пользователь совершает следующее действие, и диалог развивается по непредсказуемой траектории. Статический датасет такую динамику воспроизвести не может.
Что такое OmniAssistBench
OmniAssistBench: это бенчмарк для оценки омни-модальных больших языковых моделей (Omni-LLM) в роли интерактивных видеоассистентов. Он содержит 300 видео, 685 пар вопрос-ответ, 7 основных задач с 16 подзадачами и 3 реальных сценария, снятых специально для тестирования. На создание датасета ушло более 1000 часов экспертной разметки, причём авторы сознательно отказались от автоматических пайплайнов: задачи построены вокруг неочевидных деталей видео и целей пользователя, которые модели в субтитрах не выделяют.
Ключевая методологическая находка: решение проблемы расходящихся путей. Один и тот же результат пользователь может достичь разными способами, и если модель подскажет альтернативный маршрут, статический тест сломается. Поэтому авторы выдают модели заранее зафиксированный приор, стандартный процедурный путь, выведенный из исходного видео, и требуют вести пользователя строго по нему. Сами видео реконструированы из интернет-роликов: эксперты выводят логическую цель пользователя, нарезают видео на многоходовые клипы и встраивают реплики пользователя прямо в конец каждого фрагмента аудиодорожкой или картинкой-в-картинке.
Важная деталь дизайна: все вопросы открытые, без вариантов ответа. Авторы заметили, что multiple-choice подсказывает модели, на что смотреть: она сначала ищет в видео объекты из опций, а потом решает, какая подходит. В реальной жизни подсказок нет, и бенчмарк честно воспроизводит это условие.
Два уровня сложности: от жестов до многошаговых процессов
Базовый уровень проверяет восприятие, без которого ассистент бесполезен. Социальное восприятие требует понять, кто с кем говорит и какие эмоции выражает, причём в длинных сценах, а не по одной реплике. Временное восприятие проверяет память на незаметные детали: какого цвета была одежда человека, прошедшего на фоне в тот момент, когда герой произнёс ключевую фразу. Референциальное восприятие заставляет различать похожие объекты: на какого именно из нескольких студентов указывает преподаватель. Отдельный блок посвящён неаудиальным промптам: жесты рук, текст, написанный на физических объектах. Это критично для инклюзивных сценариев, например для людей с нарушениями речи, и почти не покрыто другими тестами.
Продвинутый уровень моделирует собственно ассистентское поведение. Контекстно-зависимый ответ требует давать советы, привязанные к конкретной обстановке: не «скачайте FFmpeg», а «нажмите вот эту кнопку, у вас Windows». Проактивный ответ проверяет чувство времени: пользователь просит «скажи номер следующего такси», и модель должна молчать, пока машина не появится в кадре. Отслеживание процессов: длинные многошаговые задачи вроде готовки по рецепту или покупок по списку, где нужно помнить, что уже сделано.
Три реальных сценария сняты отдельно и длятся в среднем 15 ходов диалога. Симуляция совещания: 20-минутный поток с 12 участниками, где модель ведёт заметки и ищет информацию. Помощь слепому пользователю: навигация по офису с рукописной картой и напоминание, когда нужный человек появится. Совместная работа над поделкой: трое людей, и модель должна отличать реплики, адресованные ей, от разговора между участниками.
Результаты: понимать понимают, а помочь не могут
Оценку проводил LLM-судья на базе GPT-5 по пятибалльной рубрике, нормированной на 100 баллов. Порог 60 означает минимально валидный ответ, 40 соответствует ситуации, когда модель поняла инструкцию, но ответила фактически неверно. Корреляция оценок между разными судьями (включая DeepSeek-v3.2) превышает 0.75, так что рубрика воспроизводима.
Gemini-3-Pro лидирует с 66.4 балла, то есть едва перешагивает порог валидности. Qwen3-Omni-Instruct, лучшая из открытых моделей, набирает 51.2. На реальных сценариях разрыв между закрытыми и открытыми моделями особенно заметен: 51.2 против 34.8 в среднем. Даже Gemini-3-Pro, который обогнал предшественника более чем на 20 баллов, теряет мелкие объекты в длинных сценах, когда они выходят из кадра, и не может связать рукописную карту с реальным помещением в сценарии помощи слепому.
Общая картина по формулировке авторов: модели в целом понимают, что от них хотят, но дают некорректные или неполные ответы.
Где именно ломаются модели
Жесты оказались слепой зоной всех протестированных систем, и открытых, и проприетарных. Причины две. Перцептивная: жесты абстрактны и легко путаются со случайными движениями людей в кадре или фоновым шумом. Данных: в обучающих корпусах инструкций, привязанных к жестам, просто мало. Для инклюзивных интерфейсов это серьёзный сигнал.
Контекстное окно превращается в бутылочное горлышко на длинных видео. MiniCPM-o-2.6 с окном 32k токенов удерживает примерно 380 секунд видео при частоте 1 кадр в секунду, после чего начинает генерировать бессвязный текст. Семейство Qwen кодирует каждый кадр большим числом токенов, и эффективная память сжимается до 80 секунд. Для многоходовых задач бенчмарка этого недостаточно. Попытка снизить разрешение с 1080p до 360p, чтобы втиснуть больше кадров, прироста не дала: модели теряют детали быстрее, чем выигрывают в длине контекста.
Третий класс отказов касается самоконтроля. Модели не умеют ждать: в задачах на проактивный ответ они либо отвечают раньше времени, либо отвлекаются на фоновую речь в видео и забывают исходную просьбу пользователя. Особенно показательна абляция по модальностям: при отключении звука результаты на проактивных задачах у всех моделей улучшились. Без аудио их перестаёт сбивать чужая речь, и они держат фокус на первоначальной инструкции. Это значит, что текущие модели не идентифицируют конкретного пользователя в потоке, а реагируют на любую услышанную реплику.
Четвёртая проблема: псевдоотслеживание задач. Когда пользователь называет несколько задач по именам, большинство моделей (кроме Gemini-3-Pro) могут описать, что происходит в кадре, но не связывают описание с конкретным пунктом TODO-списка. Они фильтруют видео по ключевым словам из промпта, а не ведут настоящий учёт прогресса.
Почему это важно
OmniAssistBench фиксирует разрыв между маркетингом и реальностью. Демонстрации омни-ассистентов выглядят убедительно, но систематическая проверка показывает: базовые навыки вроде понимания жестов и удержания контекста на уровне, недостаточном для практического применения. Порог 60 баллов, минимум для валидного ответа, покоряется только одной модели из одиннадцати, и та набирает 66.
Для разработчиков открытых моделей бенчмарк задаёт понятную повестку: долговременная память поверх ограниченного контекста, данные с жестовыми инструкциями, механизмы идентификации говорящего. Интересно, что узкие места лежат не в рассуждении, а в восприятии и самоконтроле, то есть в слоях, которые обычно считаются уже решёнными.
Часто задаваемые вопросы
Чем OmniAssistBench отличается от обычных видео-бенчмарков?
Обычные бенчмарки проверяют пассивное понимание: модель смотрит видео и отвечает на вопрос. OmniAssistBench моделирует интерактив: многоходовые диалоги, встроенные в видео реплики пользователя, задачи, где модель должна сама решать, когда отвечать. Все вопросы открытые, без вариантов ответа, что исключает подсказки через опции.
Почему модели показывают такие низкие результаты?
Основные причины: слабое распознавание жестовых инструкций, нехватка контекста для длинных видео (эффективная память 80–380 секунд), неспособность ждать нужного момента для ответа и отвлечение на фоновую речь. Лучшая модель, Gemini-3-Pro, набирает 66.4 из 100, что едва выше порога валидного ответа.
Как устроена оценка ответов?
Ответы оценивает LLM-судья на базе GPT-5 по пятибалльной рубрике, нормированной на 100. Балл 60 означает минимально осмысленный ответ, 40: модель поняла задачу, но ошиблась фактически. Рубрика штрафует за избыточность, чтобы модель не могла набрать баллы, просто описывая всё видео целиком.
Итог
OmniAssistBench впервые измеряет омни-модели в той роли, для которой их активно продают: живой видеоассистент. Вывод неутешительный: между пониманием запроса и реальной помощью лежит пропасть из жестов, контекста и самоконтроля. Если вы строите продукт на Omni-LLM, этот бенчмарк стоит прогнать до того, как обещать пользователям «ассистента, который видит и слышит». Цифры пока говорят обратное.