BAMI: как повысить точность GUI-агентов без дообучения

BAMI: как повысить точность GUI-агентов без дообучения

Графические интерфейсы выглядят простыми для человека, но остаются настоящим испытанием для мультимодальных языковых моделей. Попроси агента нажать кнопку «Export» в профессиональном редакторе — и он с равной вероятностью попадёт в соседний дропдаун, потому что пиксельно различить цель от окружения сложнее, чем кажется. Ирония в том, что последние MLLM отлично понимают запрос, видят скриншот, но теряют точность именно в локализации — самой важной способности для GUI-агента.

Исследование BAMI (Training-Free Bias Mitigation in GUI Grounding), опубликованное на arXiv в мае 2026 года, показывает, как заметно повысить точность grounding без дообучения весов. Авторы предлагают две манипуляции на этапе inference — coarse-to-fine focus и candidate selection — которые устраняют две системные ошибки MLLM: accuracy bias и ambiguity bias. На сложном бенчмарке ScreenSpot-Pro это даёт прирост в несколько процентных пунктов, включая рост TianXi-Action-7B с 51,9% до 57,8%.

Что такое GUI grounding и почему это узкое горло агентов

GUI grounding — это способность модели по текстовой инструкции и скриншоту определить координаты нужного элемента интерфейса. Если агент должен «нажать на кнопку Save», grounding-модель выдаёт bounding box или точку клика. От её точности зависит всё последующее выполнение задачи: неправильный клик приводит к неправильному состоянию приложения, ошибки накапливаются, и задача проваливается.

Ранние подходы опирались на структурные представления — XML, DOM-деревья, accessibility-теги. Но в реальном мире эти структуры часто недоступны, неполны или не соответствуют тому, что видит пользователь на экране. Поэтому современные системы, такие как OS-Atlas, UI-TARS, ShowUI и OmniParser, работают напрямую с пикселями: на входе — инструкция и скриншот, на выходе — координаты.

Проблема в том, что GUI-скриншоты отличаются от обычных фотографий. Разрешение высокое, элементы мелкие и плотно сгруппированы, а семантика определяется сочетанием иконки, текста и контекста. Окно может содержать сотню похожих прямоугольников, и лишь один из них отвечает запросу. В результате даже сильные MLLM, предобученные на огромных визуально-языковых корпусах, дают заметный процент ошибок локализации на профессиональных интерфейсах.

Два источника ошибок: accuracy bias и ambiguity bias

Авторы BAMI провели систематический пилотный анализ на ScreenSpot-Pro — бенчмарке, состоящем из скриншотов профессионального софта с множеством мелких элементов. Оказалось, что большинство ошибок grounding сводится к двум индуктивным смещениям модели, которые не зависят от обучающих данных.

Accuracy bias — это тенденция MLLM дискретизировать координаты грубо. Модель предсказывает координаты токенами, и её разрешение по умолчанию ограничено. На практике это означает, что предсказанная точка может отклоняться от истинного центра на десятки или даже сотни пикселей. Для крупных кнопок это не критично, а для маленьких иконок в профессиональных панелях — промах.

Ambiguity bias возникает, когда в поле зрения находится несколько семантически близких элементов. Представьте, что в запросе фигурирует слово «Layer», а в интерфейсе есть одновременно кнопка «New Layer», пункт меню «Layer» и панель «Layers». Модель может сосредоточиться на неправильном кандидате, потому что визуально он кажется более заметным или чаще встречался в обучении. Это не ошибка координат, а ошибка выбора объекта.

Важно, что оба bias — это не следствие недостаточного обучения в классическом смысле. Модель уже обладает нужным знанием, но способ декодирования координат заставляет её действовать неоптимально. Следовательно, можно улучшить результат без backpropagation, меняя лишь процесс inference.

Как работает BAMI: две манипуляции на этапе предсказания

Метод BAMI строится на двух стратегиях, каждая из которых адресует один из bias. Обе стратегии работают поверх готовой MLLM и не требуют размеченных данных или GPU-часов на fine-tuning.

Первая стратегия — coarse-to-fine focus — борется с accuracy bias. Вместо того чтобы сразу просить модель дать точный ответ на полном высокоразрешённом скриншоте, BAMI разбивает локализацию на два шага. Сначала модель предсказывает грубые координаты цели на исходном изображении. Затем по этим координатам вырезается небольшая область вокруг предполагаемого объекта — crop с коэффициентом масштабирования λ меньше единицы. Этот crop подаётся обратно в модель, которая теперь работает с увеличенным фрагментом и уточняет координаты. Процесс можно итерировать, но авторы обнаружили, что после двух итераций прирост выходит на плато.

Выбор гиперпараметров здесь неочевиден. Слишком большой crop не даёт увеличения, слишком маленький — рискует вырезать важный контекст. В экспериментах BAMI используется λ в диапазоне от 0,5 до 0,7 в зависимости от разрешения, и две итерации оказываются достаточным компромиссом между точностью и латентностью.

Вторая стратегия — candidate selection — решает ambiguity bias. Модель генерирует несколько кандидатных координат или bounding box, а не один. Для каждого кандидата изображение маскируется так, чтобы оставить только соответствующую область, и вспомогательная correction-модель оценивает, насколько кандидат соответствует текстовому запросу. В итоге выбирается наиболее релевантный вариант. Авторы используют 2–3 кандидата на итерацию и показывают, что это достаточно для существенного снижения ошибок неправильного выбора объекта.

Интересно, что correction-модель может быть как внешней API-моделью — в работе используется GPT-5, — так и локальной Qwen3-VL-8B. Локальная модель, обученная на публичных данных, достигает 56,2% на ScreenSpot-Pro, при этом её параметры сопоставимы с размером самих grounding-моделей. Это важно для сценариев, где внешний API недопустим по соображениям приватности или латентности.

Результаты: сколько даёт training-free подход

Главный бенчмарк — ScreenSpot-Pro, собранный из скриншотов профессиональных приложений. На нём точка входа сильных grounding-моделей, таких как OS-Atlas-7B и UI-TARS-1.5-7B, падает ниже 50%, что показывает, насколько сложны реальные интерфейсы. BAMI улучшает все протестированные модели без единой эпохи дообучения.

TianXi-Action-7B получает наиболее впечатляющий прирост: с 51,9% до 57,8%. UI-TARS-1.5-7B и OS-Atlas-7B также показывают стабильный рост. Для сравнения, многие методы, требующие fine-tuning на специализированных GUI-датасетах, улучшают базовые модели на сопоставимые величины, но ценой сбора данных, разметки и GPU-часов. BAMI даёт часть этого выигрыша почти бесплатно — лишь за счёт более умного inference.

На более простом ScreenSpot-V2, который охватывает мобильные, веб- и десктопные интерфейсы, эффект тоже положительный, но менее драматичный. Это логично: в простых сценариях accuracy bias и ambiguity bias проявляются слабее, поэтому margin для улучшения меньше. В профессиональных интерфейсах, где плотность элементов высокая, польза от BAMI максимальна.

Почему это важно для разработчиков и продуктов

Практический смысл BAMI в том, что он разделяет две проблемы: качество модели и качество декодирования. Часто команды считают, что если агент промахивается, нужно собирать новый датасет и дообучать модель. Но это дорогой и медленный путь. BAMI показывает, что сначала стоит оптимизировать inference-стратегию: увеличение локальной детали, многокандидатный выбор, вспомогательная correction-модель.

Для продуктовых GUI-агентов это означает возможность быстро поднять success rate без пересборки пайплайна обучения. Для исследователей — напоминание, что поведение MLLM на визуальных задачах определяется не только весами, но и индуктивными предпочтениями декодера. Понимание этих bias открывает целое семейство training-free улучшений, применимых к другим задачам локализации.

Кроме того, локальный вариант correction-модель на Qwen3-VL-8B делает подход применимым в закрытых корпоративных средах. Не нужно отправлять скриншоты интерфейсов в сторонний API — достаточно развернуть небольшую модель рядом с grounding-моделью и сразу получить прирост точности.

Где BAMI находится среди других подходов

Современные GUI-агенты развиваются в двух направлениях одновременно. Первое — масштабирование обучения: модели вроде UI-TARS, OS-Atlas и AGUVIS собирают миллионы размеченных GUI-элементов и обучаются на них end-to-end. Второе — улучшение inference без изменения весов: методы само-исправления, многократной дискретизации, деревьев поиска. BAMI относится ко второму направлению и дополняет первое, не заменяя его.

ShowUI и OmniParser, например, улучшают grounding за счёт структурированных токенов и внешних парсеров интерфейса. CogAgent вводит кросс-разрешённое внимание, чтобы справляться с высокими скриншотами. UGround расширяет обучающий датасет до 10 миллионов элементов. Все эти работы меняют саму модель или её входные данные. BAMI, напротив, принимает модель как есть и спрашивает: а можно ли получить больше от того, что уже есть?

Это стратегически важный вопрос, потому что дообучение больших MLLM обходится дорого, требует размеченных GUI-данных и часто привязывает модель к конкретному семейству интерфейсов. Training-free методы универсальнее: их можно применить к любой готовой MLLM, будь то Qwen-VL, GPT-4o vision или новая модель, которая выйдет через месяц. BAMI — не альтернатива UI-TARS, а способ сделать UI-TARS точнее без его переобучения.

Границы метода

BAMI не делает grounding идеальным. На ScreenSpot-Pro лучший результат всё равно остаётся далёким от 100%, что говорит о глубине проблемы. Метод работает лучше всего, когда ошибки вызваны именно accuracy bias и ambiguity bias. Если же модель неправильно понимает запрос или не распознаёт элемент семантически, BAMI не поможет — нужно улучшать саму модель.

Кроме того, coarse-to-fine focus увеличивает латентность: вместо одного forward pass требуется два и более. Для реального агента важно, чтобы задержка не превышала допустимую. Авторы используют два прохода и показывают, что прирост точности стоит небольшого увеличения числа вызовов. Но в latency-критичных сценариях придётся балансировать между числом итераций и crop-размером.

Наконец, correction-модель требует собственного внимания. API-вариант на GPT-5 удобен, но вводит зависимость от внешнего провайдера и приватность скриншотов. Локальный вариант на Qwen3-VL-8B решает эти проблемы, но добавляет инфраструктурную сложность: нужно разворачивать вторую модель рядом с первой и поддерживать её.

Часто задаваемые вопросы

BAMI требует дообучения исходной MLLM?

Нет. Метод полностью training-free для самой grounding-модели. Единственная обучаемая компонента — correction-модель, и даже она может быть заменена на готовый API. Локальная correction-модель обучается на публичных данных, но не требует проприетарных скриншотов пользователя.

Почему простое увеличение crop не решает проблему само по себе?

Потому что увеличение без контекста теряет информацию. Если модель сразу резко увеличит неправильный фрагмент, она просто даст точный ответ про неправильный объект. Coarse-to-fine сначала находит примерную область в полном контексте, а затем уточняет детали — это две разные задачи, и каждая выполняется в своём масштабе.

Какие задачи выиграют больше всего?

Наибольший эффект на профессиональных интерфейсах с высокой плотностью мелких элементов: дизайнерские редакторы, IDE, панели аналитики, системы управления проектами. В простых мобильных интерфейсах с крупными кнопками улучшение заметно меньше.

Итог

BAMI доказывает, что точность GUI grounding можно поднять без дообучения основной модели. Две манипуляции — coarse-to-fine focus и candidate selection — устраняют accuracy bias и ambiguity bias, которые возникают не от нехватки данных, а от способа декодирования координат MLLM. На сложном бенчмарке ScreenSpot-Pro это даёт прирост в несколько процентных пунктов, включая рост TianXi-Action-7B с 51,9% до 57,8%.

Для инженеров, строящих GUI-агентов, это означает: перед тем как планировать сбор нового датасета, проверьте, насколько эффективно вы используете уже обученную модель. Иногда правильный inference — это самый быстрый способ сделать агента точнее.

← Все записи