Task Model Induction: агенты учатся по записям экрана

Task Model Induction: агенты учатся по записям экрана

Большая часть реальной работы за компьютером нигде не документируется. Аналитик собирает отчёт, инженер чинит пайплайн, дизайнер гоняет макеты — и всё это остаётся лишь в памяти человека. Новое исследование предлагает превратить эти невидимые процессы в явные, проверяемые модели задач, на которых смогут учиться ИИ-агенты.

Идея проста по формулировке и сложна в реализации: взять пассивную запись сессии — скриншоты, движения мыши, нажатия клавиш — и автоматически восстановить, какие задачи человек решал и в каком порядке. Работа Yucheng Jiang, Zora Zhiruo Wang, Ruishi Chen и Diyi Yang представляет метод Task Model Induction (TMI), который справляется с этой задачей заметно лучше существующих подходов.

Что такое Task Model Induction

Task Model Induction — это задача автоматического восстановления структурированной модели работы из сырой записи компьютерной активности. Метод должен сам обнаружить, какие задачи были скрыты в сессии, разделить перемешанные действия между ними и для каждой задачи построить пару моделей: иерархию целей (что и зачем делалось) и модель процедуры (в какой последовательности, с какими циклами и ветвлениями это выполнялось).

Отличие от привычных подходов принципиально. Суммаризация через LLM сжимает сессию в прозу, теряя иерархию целей и поток управления. Прямой промпт «построй модель задачи» восстанавливает схему, но не структуру исполнения. Индукция воркфлоу предполагает, что задача одна и известна заранее. TMI снимает все эти допущения: задачи латентны, их количество неизвестно, а действия разных задач перемешаны во времени.

Почему это трудная задача

Авторы выделяют три уровня сложности. Первый — сигнальный: клик с координатами (1900.8, 29.5) сам по себе не несёт смысла, и чтобы понять намерение, нужно смотреть на визуальный контекст до и после события. Второй — структурный: реальная работа многопоточна. Исследования когнитивистики давно показали, что knowledge workers постоянно переключаются между несвязанными целями внутри одной сессии, и действия разных задач чередуются. Третий — репрезентативный: запись показывает выполненный путь, но не раскрывает ни иерархию целей, которая мотивировала каждый шаг, ни логику управления, которая организовала исполнение.

Как работает TMI: три стадии

Пайплайн начинается с grounding событий и сегментации активности. Vision-language модель получает пару скриншотов, обрамляющих каждое событие, вместе с записанной операцией и описывает, что было сделано, с каким артефактом и в каком приложении, плюс OCR-транскрипт видимого экрана. Смысл события выводится из визуального изменения, которое оно произвело. Осмысленные события группируются в семантические действия, а те — в активности: атомарные единицы, на уровне которых уже можно судить о намерении пользователя.

Вторая стадия — индукция латентных задач. Каждая активность назначается ближайшей существующей задаче или открывает новую. Идентификаторы сохраняют целостность задачи даже когда пользователь меняет приложение или формулировку, так что одна задача может занимать несколько несмежных отрезков сессии.

Третья стадия — построение модели задачи. Для каждой обнаруженной задачи отдельно строятся объективная модель (рекурсивная декомпозиция целей) и процедурная модель (поток управления исполнения), а затем они сверяются и объединяются в единую модель, где каждый узел несёт и цель, и оператор управления над дочерними узлами. Эта сверка важна: объективная модель сама по себе сливает разнородные действия в один лист, а процедурная теряет элементы тела цикла. Примирение восстанавливает оба дефекта.

Как устроена процедурная модель

Процедурная модель опирается на классический результат структурного программирования Бёма — Якопини: любой поток управления выражается через последовательность и итерацию. TMI использует три оператора — sequence, for-each и while, — потому что именно они остаются наблюдаемыми в записи исполнения. Ветвление if в траектории обычно латентно: запись показывает выбранную стратегию, а не отвергнутые альтернативы и не явный момент решения. Каждый оператор допускается своим типом свидетельства: sequence — временным порядком шагов, for-each — повторяющимся паттерном действий над серией однотипных объектов, while — повторением до достижения состояния.

Проверка вклада примирения моделей показательна. Вариант с совместной индукцией, где объективная и процедурная модели строятся одним проходом, достигает лишь 63.2% точности описания шагов против 74.9% у полной модели — цели и поток управления сливаются в одну плоскую последовательность. При этом такой вариант производит вдвое меньше узлов, и его высокие попунктовые оценки отражают грубость представления, а не точность структуры. Двухстадийная схема с последующей сверкой сохраняет и детализацию, и верность исполнению.

Эксперименты: люди и агенты

Оценка строилась на двух датасетах. HumanWork содержит 38 записанных сессий по 15 задачам из пяти профессиональных областей — анализ данных, инженерия, вычисления, письмо и дизайн. Это 42.8 часа записи и 48.7 тысячи сырых событий, в среднем 68 минут и 1.3 тысячи событий на сессию. Второй источник, SkillsBench, покрывает 86 задач разработки ПО, выполненных кодинговыми агентами в трёх обвязках: Claude Code, Codex и Gemini CLI. Из них отобраны 15 задач с наибольшим числом действий — 195 прогонов, 24.1 тысячи шагов агентов и 49.7 часов исполнения.

Чтобы проверить устойчивость к перемешиванию, авторы синтетически усложняли траектории: брали K сессий, резали каждую на d сегментов и тасовали в единый поток. K варьировалось от 2 до 15 одновременных задач, d — от 2 до 4 точек возврата к каждой. Это имитирует реальный паттерн, когда человек постоянно возвращается к отложенному делу. Отдельно измерялась стабильность индукции: одна и та же задача должна распознаваться как та же самая независимо от того, кто и как именно её выполнял, то есть модель отслеживает идентичность задачи, а не идиосинкразию исполнения.

Вся инженерия пайплайна построена на gpt-5.4 с температурой 1.0 — все три стадии, от grounding событий до сверки моделей. Внутренняя оценка качества выполнялась двумя независимыми судьями, gpt-5.5 и claude-sonnet-5, чтобы исключить привязку результатов к одной модели-оценщику. Промпт-шаблоны каждой стадии опубликованы в приложении к статье, что делает пайплайн воспроизводимым.

Результаты

По разделению перемешанных задач TMI достигает согласия 0.974 с эталонной разметкой групп. По точности восстановления процедур метод описывает 74.9% наблюдаемых шагов исполнения против 30.3% у сильнейшего бейзлайна индукции воркфлоу, а корректность операторов потока управления составляет 88.5% против 52.7% (оценка судьёй gpt-5.5; порядок сохраняется и под claude-sonnet-5).

Интересна деталь из разбора объективных моделей. Прямая генерация строит в среднем лишь 3.8 узла целей на сессию, совместная индукция без сверки — 8.6, а полный TMI — 19.5. Более грубые узлы легче проходят проверки согласованности, поэтому часть «качества» бейзлайнов — артефакт мелкой гранулярности. При этом вариант без примирения моделей лидирует только в двух проверках, наименее чувствительных к детализации, и проигрывает полному методу по непересекаемости соседних подцелей у обоих судей.

Главный тест: перенос в навыки агентов

Полезность модели задачи проверялась экстринсически — через генерацию переиспользуемых навыков на SkillLearnBench, бенчмарке из 20 семейств задач для непрерывного обучения агентов. Из одной успешной демонстрации индуцировалась модель задачи, она передавалась создателю навыков Codex, а полученный навык разворачивался на отложенных экземплярах того же семейства. Все навыки генерировались и исполнялись на gpt-5-mini, так что различия изолируют именно источник обучения.

Навыки, выученные из моделей задач, оказались исполняемее и лучше переносились: метрика executability выросла с 59.35 до 67.65, а точность на отложенных задачах — с 14.29 до 18.57, то есть относительный прирост 30% к сильнейшему бейзлайну. Самый любопытный результат — про экспертные навыки. Написанные людьми инструкции показывают наивысшее покрытие (93.59), но точность на отложенных задачах у них всего 10.00 — ниже любого индуцированного источника. Покрытие навыка и его реальная польза для агента в этом сеттинге не коррелируют: эксперт пишет для человека, а агенту нужна структура, привязанная к исполнению.

Чем это отличается от существующих подходов

Классическое распознавание планов выводит цели из наблюдаемых действий, но требует заранее заданной библиотеки планов или теории домена. Process mining строит процедурные модели из журналов событий, где активности уже типизированы и снабжены идентификаторами кейсов — то есть самая трудная часть работы выполнена до начала анализа. Свежие работы по компьютерным трассам либо переводят пиксели в семантические операции, либо извлекают последовательности шагов, либо анализируют траектории при известной корневой задаче. TMI первым снимает все эти допущения разом: семантические действия, латентные задачи, иерархии целей и процедуры индуцируются совместно из сырого потока экрана и ввода.

Зачем это нужно на практике

Первое применение — обучение computer-use агентов без дорогой разметки. Записи реальной работы есть в избытке, а аннотированных демонстраций почти нет. Второе — аудит и документирование: организации получают явное, проверяемое описание того, как на самом деле выполняются процессы, а не как они нарисованы в регламентах. Третье — персонализация: модель активности пользователя позволяет системам предугадывать цели и подхватывать контекст.

Есть и исследовательское измерение. Если агенты начинают массово работать рядом с людьми, умение читать чужие траектории становится базовой компетенцией: агент, который понимает, что делал его предшественник в этой сессии, может продолжить работу вместо того, чтобы начинать с нуля.

Часто задаваемые вопросы

Чем TMI отличается от process mining?

Process mining работает с журналами событий, где активности уже типизированы и размечены идентификаторами кейсов. TMI стартует с сырых пикселей и кликов без какой-либо типизации: он сам выводит семантические действия, сам обнаруживает задачи и сам строит иерархии целей и процедур.

Можно ли применить TMI к записи одной задачи без перемешивания?

Да, но главное преимущество метода раскрывается именно на естественных сессиях, где задач несколько и они чередуются. На контролируемых траекториях с одной задачей выигрыш над бейзлайнами меньше, потому что сложность разделения исчезает.

Насколько это приватно — ведь записывается весь экран?

Метод пассивен: он анализирует уже существующие записи и не требует нового наблюдения. Но сам сбор таких трасс — отдельный вопрос корпоративной этики, и авторы прямо отмечают, что применение к реальным рабочим записям требует согласия и осторожной обработки чувствительных данных.

Итог

Task Model Induction показывает, что из хаоса сырых событий можно извлечь строгую структуру: 0.974 согласия при разделении перемешанных задач, почти трёхкратный отрыв по точности восстановления процедур и 30% относительного прироста точности агентов, обученных на индуцированных навыках. Самый острый вывод косвенный: экспертные инструкции, написанные для людей, агентам помогают хуже, чем модели, выведенные из реального исполнения. Если вы строите computer-use агентов, начните записывать сессии уже сейчас — этот корпус данных скоро станет ценнее любых мануалов.

← Все записи