ABBEL: как ИИ-агенты учатся помнить главное в долгих задачах
Любой агент, который работает с человеком часами, рано или поздно упирается в контекст. История взаимодействия растёт линейно, и все давно сжимают её суммаризацией: Cursor делает это прямо в обучении модели composer 2.5, а Grandcode, первая система, стабильно обыгрывающая людей в онлайн-соревнованиях по коду, тоже пересказывает историю сама себе. Выглядит разумно, но есть цифра, которая всё портит: агент, работающий по пересказу, теряет до 58% успешных решений по сравнению с агентом, который видит всю историю целиком. Cursor честно советует пользователям не запускать сжатие в середине задачи, и это уже похоже на признание проблемы.
Команда исследователей из Berkeley (BAIR), Georgia Tech и независимых лабораторий разобрала, почему так происходит, и предложила метод ABBEL. Идея в том, чтобы заменить сжатие истории на «убеждения»: компактное текстовое состояние, которое агент обновляет по новым наблюдениям и по которому принимает решения. Учит его этому отдельная награда за качество убеждений.
Что такое ABBEL
ABBEL это метод обучения агентов для длинных многошаговых задач. Вместо всей истории взаимодействия модель хранит компактный набор убеждений (belief state), обновляет его после каждого шага и выбирает действие, глядя только на него. Хитрость не в архитектуре, а в способе обучения: содержимое убеждений становится отдельной обучаемой задачей, а не побочным продуктом суммаризации.
Почему сжатие истории ломает длинные задачи
Авторы прогнали frontier-модели (DeepSeek V3, DeepSeek R1 и Gemini 2.5 Pro) через несколько сред с многошаговыми взаимодействиями: Wordle, Mastermind, Twenty Questions и другие. При работе по сжатым убеждениям успешность падала на величину до 50% у DeepSeek V3, до 58% у R1 и до 17% у Gemini 2.5 Pro. Разрыв воспроизвёлся в разных средах и на разных моделях, так что это не баг конкретной системы, а свойство подхода.
Разбор логов вскрыл две причины. Первая: модель неверно обновляет убеждение из-за ошибки в рассуждении. Например, решает, что секретный код не может содержать повторяющиеся символы, и строит на этом выводы. Вторая причина неприятнее: модель выдумывает воспоминания. В одном из примеров R1 «вспомнил» отзыв на попытку 4568, которой никогда не было, заключил из галлюцинированного ответа, что семёрка стоит в четвёртой позиции, и вычеркнул правильный код 4518 из своего же списка вариантов.
Исправить такие ошибки внутри одного эпизода почти нельзя. Неверное убеждение переезжает в следующие шаги и размножается, а противоречащее наблюдение приходит слишком поздно: модели обычно самокорректируются, но потерянные ходы не вернуть.
Обучением это не исправляется
Логичный вопрос: если модель плохо сжимает, может, просто доучить её? Это проверили в Combination Lock, игре в стиле Wordle с 16 попытками. Авторы обучили две политики: одну с полным контекстом, другую со сжатием. За время RL-тренировки суммаризирующая политика улучшалась, но разрыв с полным контекстом не закрывался никогда.
Причина в том, что сжатие добавляет к задаче вторую задачу, и решать обе одновременно сложнее. По-хорошему это лечится количеством данных, но генерировать качественные многошаговые взаимодействия нечем: симуляторы человеческого поведения пока слабые, а ручные траектории дорогие (Lin et al., 2025; Tomlin et al., 2025).
Убеждения как бутылочное горлышко
ABBEL разводит два процесса, которые обычно смешаны. Каждый шаг состоит из двух вызовов модели: сначала она обновляет убеждение по предыдущему состоянию, своему действию и новому наблюдению, затем выбирает действие, видя только обновлённое убеждение. Полная история в контекст больше не возвращается.
Приём вдохновлён рекурсивной байесовской оценкой: убеждение это сжатая версия состояния мира, которая уточняется с каждым наблюдением. Выглядит лаконично. Вот реальное убеждение R1 из Mastermind: «Исключены: 0, 6, 9. Возможные коды: 45[1/2/3][7/8], 45[7/8][1/2/3]». Дальше модель выбирает следующий ход, видя только эти две строки, а не весь протокол игры.
Сжатие получается настоящим: к двадцатому шагу длина убеждений у DeepSeek V3 и R1 составляла 21% и 27% от длины полной истории, у Gemini 2.5 Pro 52%. История растёт линейно, а убеждения почти не растут или даже сокращаются: варианты отпадают, и запись становится короче. Исключение одно: Gemini в Twenty Questions склеивал ответы дословно, и его убеждения обогнали полную историю, не дав выигрыша в точности.
Belief grading: награда за качество убеждений
Главное в методе это обучение. Каждому сгенерированному убеждению назначается оценка от функции belief grader, и модель получает награду за то, чтобы писать убеждения лучше. В коде эвристика звучит так: короче лучше, но по убеждению должно восстанавливаться содержимое git diff. Баланс этих требований и даёт хорошее сжатие.
Для доменов, где эвристику не придумать, есть универсальная схема, вдохновлённая автоэнкодерами. Та же модель работает и энкодером, и декодером, а роль кода играет убеждение. Награда зависит от того, насколько хорошо по убеждению восстанавливается последнее наблюдение: убеждение должно нести новую информацию по сравнению с предыдущим состоянием, и эта информация должна объясняться свежим наблюдением.
Технически это встраивается в GRPO. Для каждого шага генерируется группа вариантов убеждения, и они сравниваются между собой по оценке. Если убеждение получило слишком низкий балл, следующие шаги этой траектории не оцениваются, чтобы модель не наказывалась за ошибку, унаследованную от плохого исходного состояния.
Что показали эксперименты
Основной замер прошёл в ColBench, среде коллаборативного программирования. Агент общается с симулированным человеком (Gemma 3 27B), уточняет требования за максимум 10 вопросов и пишет функцию на Python до 50 строк, которую проверяют 10 скрытых тестов.
Полный контекст даёт 52% пройденных тестов и 39% полностью решённых задач. ABBEL без belief grading опускается до 46% и 31%. С reconstruction grading агент поднимается до 48% и 36%: это примерно вдвое сокращает отставание от полного контекста, обучение занимает 50 шагов вместо 100, а памяти тратится на 57% меньше.
В Combination Lock с доменной эвристикой (проверяем, восстанавливаются ли из убеждения полезные статистики истории) ABBEL догоняет и местами обгоняет полный контекст по скорости обучения. В multi-objective QA из работы MEM1 штраф за длину убеждений снижает память почти без потери качества, тогда как аналогичные штрафы за длину рассуждений обычно ухудшают результат (Arora et al., 2025).
Меньше лишних рассуждений
Отдельный бонус обнаружился в замерах reasoning-токенов. С готовым убеждением на руках модели не нужно восстанавливать картину мира из сырой истории. На выбор действия DeepSeek R1 тратит на 62% меньше токенов рассуждений, чем с полным контекстом, а Gemini 2.5 Pro на 19% меньше. С учётом двух вызовов на шаг R1 всё равно экономит 24% суммарных токенов на шаг. У Gemini суммарно выходит на 48% больше, потому что его собственные убеждения длиннее, но и у него фаза выбора действия стала дешевле.
В трейсах видно, откуда экономия. Модель с полным контекстом часто первым делом сама переписывает историю в убеждение, и делает это на каждом шаге. Явные убеждения убирают эту двойную работу.
Другие способы уложить историю в контекст
У управления длинным контекстом есть и другие решения, и у каждого свои издержки. Плотное сжатие превращает историю в компактные векторы: экономно по вычислениям, но человек уже не может прочитать, что именно сохранено. Написанные вручную промпты для суммаризации и стратегии прореживания работают, но требуют экспертного знания конкретной среды и не позволяют агенту самому учиться, что запоминать. Внешние хранилища памяти решают другую часть задачи: они дают доступ к данным, но не отвечают за то, как выглядит рабочий контекст следующего шага. ABBEL занимает нишу обучаемого сжатия на естественном языке: содержимое остаётся текстом, который можно прочитать и проверить, а стратегия запоминания оптимизируется как часть обучения.
Что это значит на практике
Автосжатие контекста не бесплатная оптимизация, а компромисс, который сейчас оплачивается качеством. Если в вашем агенте есть механизм compaction, стоит измерить, сколько задач он съедает: разница в экспериментах измерялась десятками процентов, а не единицами. Особенно это касается сценариев «человек плюс агент»: в коллаборативном кодинге траектории длинные, а качественных обучающих данных мало, поэтому цена каждого потерянного хода высокая. Практический минимум, который следует из работы: следите, не теряет ли агент детали к середине задачи, и держите возможность откатиться к полной истории на критичных шагах.
Метод не отменяет внешнюю память и RAG. Авторы называют их совместимыми: хранилища дают доступ к информации, а belief states определяют, что попадёт в рабочий контекст следующего шага. Направления развития: награждать действия по тому, как они меняют убеждение, передавать убеждения между агентами, давать пользователю редактировать память напрямую. В длинном горизонте исследователи ждут систем с несколькими формами памяти: рабочей в контексте плюс отдельными краткосрочными и долгосрочными, возможно через test-time training и адаптеры.
Часто задаваемые вопросы
Почему бы просто не увеличивать контекст?
Окно растёт, но внимание дорожает. По оценке из статьи, DeepSeek V4 Pro (1,6T) доходит до точки, где половину вычислений съедает внимание, только к 450 тысячам токенов, а Qwen 3.5 397B к 150 тысячам. Это заметно лучше 25 тысяч у моделей прошлых поколений, но длинные задачи упираются ещё и в качество убеждений: ошибки в сжатиях копятся быстрее, чем расширяется окно.
Что такое belief grading простыми словами?
Это награда за качество конспекта. Агент получает балл за то, насколько по его убеждению можно восстановить то, что реально произошло. Компактность плюс информативность, взвешенные вместе. Обучение с такой наградой идёт вдвое быстрее и возвращает заметную часть потерянного качества.
Заменяет ли ABBEL RAG и внешнюю память?
Скорее дополняет. Внешняя память отвечает на вопрос «где взять информацию», ABBEL на вопрос «что сохранить в рабочем контексте и что из этого следует». Исследователи считают подходы совместимыми и ждут будущее за их комбинацией.
Итог
Проблема длинных задач оказалась не только в размере контекста. Модель не умеет выбирать, что из истории важно, и на пересказах теряет до 58% успеха. ABBEL переворачивает схему: убеждения становятся отдельной обучаемой единицей, и это возвращает половину отставания, удваивает скорость обучения и экономит память. Если вы строите агентов, посмотрите, как ваш контекст-менеджмент ведёт себя на двадцатом шаге длинной задачи. Скорее всего, именно там спрятан главный резерв качества. Подход пока исследовательский, но направление понятное: память агента становится таким же объектом обучения, как сами рассуждения.
Первоисточники: пост в блоге Berkeley BAIR и статья ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction (arXiv 2512.20111, UC Berkeley и Georgia Tech).