UniClawBench: Первый бенчмарк способностей ИИ-агентов в реальных задачах
Представьте, что вы нанимаете ИИ-ассистента и просите его спланировать поездку, найти подходящие картинки в интернете, заполнить таблицу в Google Sheets и отправить результат в Slack. Звучит как обычный рабочий день. Но когда исследователи из Гонконгского университета (HKU MMLab) дали современным моделям именно такие задачи — лучшие из них справились менее чем с половиной.
Проблема не в том, что модели «глупые». Проблема в том, что мы до сих пор не умеем правильно измерять, что именно они могут.
Почему существующие бенчмарки устарели
До появления UniClawBench агентные бенчмарки (WebArena, OSWorld, BrowserGym) оценивали ИИ в изолированных «песочницах» — либо в зеркальных копиях сайтов, либо в кешированных страницах внутри виртуальных машин. Это как проверять навык повара на пластмассовых ингредиентах: формально всё правильно, но реальный продукт получается совсем другой.
Вторая проблема — однораундовая оценка. Агент получает инструкцию, выполняет её, получает вердикт. Но в реальной жизни взаимодействие с агентом выглядит иначе: вы даёте задание, смотрите результат, указываете на ошибки, и агент исправляется. Без этого замкнутого цикла (closed loop) бенчмарк измеряет не реальную полезность, а способность с первого раза угадать, что от него хотят.
Третья и самая критичная проблема — организация задач по сценариям. Когда бенчмарк группирует задачи по категориям «офис», «путешествия» или «разработка», при провале невозможно понять, что именно сломалось. Модель не смогла найти нужную кнопку на сайте? Не поняла длинную инструкцию? Не смогла переключиться между приложениями? Ответ скрыт внутри одной задачи, где перемешаны десятки разных способностей.
UniClawBench решает все три проблемы одновременно.
Что такое UniClawBench
Это бенчмарк, разработанный командой HKU MMLab, который оценивает проактивных ИИ-агентов — тех самых, что способны самостоятельно управлять браузером, терминалом, файловой системой и другими инструментами для решения реальных задач. В отличие от предшественников, UniClawBench построен не вокруг сценариев, а вокруг пяти фундаментальных способностей модели.
Skill Usage (использование инструментов) — умеет ли агент находить и применять нужные навыки: вызывать API, работать с CLI-утилитами, пользоваться готовыми плагинами. Например, задача может потребовать от агента прочитать документацию скилла и применить его к конкретным данным.
Exploration (исследование) — способен ли агент работать с неопределённостью. Задачи этой категории намеренно содержат шум, ложные подсказки и неполные условия. Агент должен исследовать несколько вариантов, отвергнуть неправильные и задокументировать, почему именно они не работают. Это не просто «найти ответ» — это «найти ответ, убедившись, что остальные варианты неверны».
Long-Context Reasoning (рассуждения на длинном контексте) — задачи, требующие агрегации информации из множества разнородных источников или поддержания согласованности состояния на протяжении длинных цепочек действий. Сложность не в том, чтобы найти один факт, а в том, чтобы удержать глобальную картину при работе с разбросанными данными.
Multimodal Understanding (мультимодальное понимание) — задачи, где нужно извлекать, интерпретировать и генерировать информацию на основе реальных изображений, видео или аудио. Агент должен сочетать визуальное восприятие с инструментальным использованием и генерацией контента.
Cross-Platform Coordination (кросс-платформенная координация) — синхронизация состояния между разнородными приложениями: CLI-инструменты, веб-страницы, десктопные приложения, локальные файлы, календари, менеджеры ссылок. Успех зависит от сохранения доказательств и состояния между платформами.
На основе этих пяти категорий исследователи создали 400 двуязычных задач (английский и китайский), каждая из которых выполняется в live Docker-контейнере с доступом к реальным сайтам, API и файловым системам.
Закрытая петля оценки: три роли без утечки критериев
Одна из самых интересных архитектурных находок UniClawBench — трёхролевая система оценки, которая решает проблему утечки grading-критериев.
Первая роль — Executor (исполнитель). Это тестируемый агент, который работает в реальном окружении: использует браузер, терминал, файловую систему. Его задача — выполнить задание и артефакты (JSON-файлы, скрипты, заметки).
Вторая роль — Hidden Supervisor (скрытый супервизор). Это отдельный агент (на базе GPT-5.4 с высоким reasoning effort), который видит полный трейс исполнителя и скрытые rubric-правила. Он оценивает каждый чекпоинт выполнения и выносит вердикт: pass, fail или continue (нужна доработка). Но критерии оценки не передаются исполнителю.
Третья роль — User Simulator (симулятор пользователя). Получает от супервизора только грубый сигнал прогресса через «информационный файрвол» и генерирует естественную обратную связь — как это сделал бы реальный пользователь. Например: «Ты взял не ту картинку, мне нужна была с более высоким разрешением» или «В JSON-файле пропущены два обязательных поля».
Таким образом, агент-исполнитель не знает, по каким критериям его оценивают, но получает реалистичную обратную связь и может исправить ошибки. Это воспроизводит замкнутый цикл человеческого взаимодействия без риска, что агент «научится» проходить тест, запомнив grading-правила.
Результаты: кто сколько может
Исследователи протестировали десять современных моделей в едином фреймворке OpenClaw (v2026.3.11). Вот как распределились результаты по Pass Rate (процент полностью решённых задач) и Average Score (средний балл по чекпоинтам):
Лидеры: Claude Opus 4.8 (Pass Rate 47.5%, Average Score 0.702), Claude Sonnet 4.6 (45.5% / 0.763), GPT-5.4 (40.7% / 0.774). Замыкают тройку Kimi-2.6 (36.2% / 0.709) и Gemini 3.1 Pro (32.5% / 0.727).
Аутсайдеры: GPT-4.1 показал результат всего 15.2% Pass Rate — худший среди всех протестированных моделей. Gemini 3.1 Flash Lite и GPT-4.1 оказались практически на одном уровне, что говорит о том, что «прошлогодние» модели не справляются с современными требованиями к проактивным агентам.
Но интереснее не общие числа, а разбивка по категориям способностей.
Самая слабая способность всех моделей — Multimodal Understanding. Здесь Pass Rate колеблется от 3.7% (Gemini 3.1 Flash Lite) до 21.2% (Claude Sonnet 4.6). Даже лучшая модель решает менее одной из пяти мультимодальных задач. Это означает, что когда задача требует одновременно посмотреть на картинку, извлечь из неё информацию и использовать её для генерации контента — текущие модели систематически проваливаются.
Вторая проблемная зона — Cross-Platform Coordination. Результаты варьируются от 2.5% (GPT-4.1) до 38.8% (Claude Opus 4.8). У большинства моделей этот показатель не превышает 25%. Когда агенту нужно синхронизировать данные между браузером, терминалом и локальными файлами — это создаёт непропорционально высокую нагрузку.
Самая сильная способность — Exploration. Здесь Gemini 3.1 Pro достигает 85.0% Pass Rate, Claude Sonnet 4.6 — 81.2%, Claude Opus 4.8 — 82.5%. Модели хорошо справляются с исследованием, когда нужно изучить несколько источников и отвергнуть неправильные варианты. Похоже, что именно способность к направленному поиску и верификации — это то, в чём современные LLM преуспели больше всего.
Фреймворк имеет значение
Вторая группа экспериментов проверяла, как выбор агентного фреймворка влияет на результат. Три модели (GPT-5.4, Claude Opus 4.8, Kimi-2.6) тестировались под тремя фреймворками: OpenClaw, EDICT и Nanobot.
Результаты однозначны: OpenClaw стабильно превосходит оба конкурента. GPT-5.4 под OpenClaw набирает 40.7% Overall Pass Rate, под EDICT — 33.8%, под Nanobot — 29.0%. Разница достигает 11.7 процентных пунктов — это колоссальный разрыв, объясняемый исключительно дизайном фреймворка, а не изменениями в модели.
При этом EDICT потребляет значительно больше токенов: 1.68× на входе и 18.3× на выходе по сравнению с OpenClaw для GPT-5.4. Nanobot, напротив, экономнее — 0.57× на входе и 0.95× на выходе — но ценой значительного падения качества.
Это важный вывод для практиков: архитектура агентного фреймворка (как организуются инструменты, как управляется контекст, как обрабатываются ошибки) может либо раскрыть потенциал модели, либо заблокировать его. Одна и та же модель под разными фреймворками показывает результаты, отличающиеся на 30–40%.
Как устроены задачи
Каждая задача в UniClawBench — это YAML-файл с публичным контрактом и скрытый eval_rule.md с критериями оценки. Исполнитель видит только текстовое задание; супервизор видит оба файла.
Задачи варьируются от простых (найти информацию на сайте, отформатировать в JSON) до комплексных (координация между GitHub CLI, десктопным приложением Zotero и Obsidian для создания обзора литературы с сохранением ссылок и цитат). Типичное выполнение занимает в среднем 17.4 минуты, при этом установлены лимиты: 30 минут на стандартную задачу (20 минут на один ход) и 45 минут на задачи с длинным контекстом (30 минут на ход). После первого выполнения агент получает до двух раундов обратной связи от симулятора пользователя.
Особенно показателен пример из appendix: задача по поиску пяти записей Library of Congress с чёткими правами на повторное использование. Агент первого цикла открыл сайт LOC, столкнулся с Cloudflare-защитой, переключился на прямой API через curl, проверил доступность изображений через HEAD-запросы — но совершил ошибку в форматировании данных. Симулятор пользователя указал на проблему, и во втором цикле агент переписал скрипт, перепроверил каждую запись через официальный JSON API и исправил все несоответствия. Финальный балл — 0.96 из 1.0.
Этот кейс иллюстрирует именно то, что UniClawBench хотел измерить: не «знает ли модель, как использовать API», а «умеет ли она восстанавливаться после ошибок, адаптироваться к препятствиям и принимать обратную связь».
Что это значит на практике
Для разработчиков ИИ-агентов результаты UniClawBench дают конкретные ориентиры. Мультимодальное понимание — критическое узкое место. Если ваш агент работает с изображениями (проверка скриншотов, анализ визуального контента, сопоставление графики с текстом), текущие модели будут систематически ошибаться. Это не баг конкретной реализации — это фундаментальное ограничение, подтверждённое на 10 моделях и 400 задачах.
Кросс-платформенная координация — вторая зона риска. Когда задача требует переключения между CLI, браузером и десктопными приложениями с сохранением состояния, производительность падает на 30–50% по сравнению с одно-платформенными задачами. Архитекторам агентных систем стоит закладывать избыточную проверку состояния на каждом переходе между платформами.
И главное: выбор фреймворка — это не вопрос предпочтений. Разница в 11.7 процентных пунктов между OpenClaw и Nanobot при одинаковой модели означает, что инфраструктурные решения напрямую определяют, насколько полезен ваш агент в реальности.
UniClawBench открыт: код и задачи доступны на GitHub. Это первый инструмент, который позволяет не просто сравнить агентов по общему баллу, а понять, почему они проваливаются — и какие именно способности нужно развивать.
Часто задаваемые вопросы
Чем UniClawBench отличается от WebArena или OSWorld?
WebArena и OSWorld используют изолированные песочницы с зеркальными копиями сайтов или кешированными страницами. UniClawBench выполняет задачи в live Docker-контейнерах с доступом к реальным сайтам и API. Кроме того, UniClawBench применяет замкнутый цикл оценки с обратной связью, а не однораундовую проверку.
Почему мультимодальные задачи — самая слабая категория?
Мультимодальные задачи требуют одновременного извлечения информации из изображений, видео или аудио и использования её для генерации контента или принятия решений. Даже лучшая модель (Claude Sonnet 4.6) решает лишь 21.2% таких задач. Это указывает на то, что текущие модели лучше справляются с текстовыми рассуждениями, чем с визуальным пониманием в контексте агентных задач.
Можно ли использовать бенчмарк для оценки собственных агентов?
Да. UniClawBench предоставляет YAML-формат для задач, скрытые rubric-правила и Docker-окружение. Вы можете адаптировать задачи под свой домен или добавить собственные, сохранив ту же трёхролевую архитектуру оценки (исполнитель, скрытый супервизор, симулятор пользователя).