SPADE: как ИИ сам создаёт тренировочные среды для агентов

SPADE: как ИИ сам создаёт тренировочные среды для агентов

Одна и та же нейросеть придумывает задачи и решает их. Во фреймворке SPADE (Self-Play in Adaptive Synthetic Executable Environments) языковая модель пишет полноценные тренировочные среды в виде исполняемого Python-кода, а затем учится действовать внутри них. Исследователи из девяти университетов, включая Вашингтонский университет, Стэнфорд, MIT и Карнеги-Меллон, довели схему до масштаба 30 миллиардов параметров: средний балл по восьми бенчмаркам вырос на 8,1 пункта над базовой моделью, а на агентском тесте ACEBench-Agent прирост составил 13,9 пункта.

Что такое SPADE

SPADE это фреймворк обучения с подкреплением (reinforcement learning, RL), в котором одна LLM выполняет две роли. Environment Designer пишет среды как код с интерфейсом reset() и step() по образцу OpenAI Gym: переходы состояний, функции наград, код проверки решений. Reasoning Agent учится решать задачи внутри этих сред. Каждая среда многошаговая и хранит состояние, поэтому один интерфейс покрывает и задачи на рассуждение, и сценарии с инструментами.

Главное отличие от привычных пайплайнов в том, что дизайн сред здесь не подготовительный этап, а обучаемый компонент посттренинга. Модель-дизайнер получает обратную связь по качеству задач и постепенно учится генерировать всё более полезные среды.

Формат исполняемого кода даёт практическую выгоду: среду можно запустить и проверить немедленно, без отдельного пайплайна оценки под каждую задачу. Ограничений на тематику почти нет, поэтому один и тот же интерфейс описывает и головоломку, и многошаговую работу с функциями.

Почему тренировочные среды стали узким местом

Стандартные наборы сред держат распределение задач фиксированным, пока ученик растёт. Это могут быть задания, написанные руками, примеры, синтезированные один раз, или замороженные верификаторы, но во всех случаях список целей не расширяется. Для непрерывного самоулучшения агенту нужен постоянно растущий пул разнообразных и адаптивных задач, а фиксированный пул рано или поздно упирается в потолок.

Знакомый сценарий из классического машинного обучения: датасет заканчивается, и тренировка либо переобучается на знакомых формулировках, либо начинает вознаграждать запоминание вместо решения. Агентским моделям нужны не только более сложные задачи, но и новые их типы, а ручная генерация не масштабируется по стоимости.

Аналогия с кризисом данных тут уместна, но с поправкой. Текстовым моделям не хватало текста, и на помощь пришла синтетика. Агентам же нужны не примеры, а целые миры: каждую задачу приходится оборачивать в среду с правилами, состоянием и проверкой решения. Написать такую среду руками это часы инженерной работы, и именно поэтому библиотеки сред растут медленнее, чем аппетиты тренировочных пайплайнов.

SPADE отвечает на это циклом, в котором дизайнер и решатель обновляются вместе: после каждой итерации среды становятся сложнее и разнообразнее. Среди них есть игровые миры, например симуляция генетического эксперимента в биолаборатории со своими правилами переходов, и среды для работы с инструментами, где агент вызывает функции и API.

Привилегированные подсказки как сигнал сложности

Ключевой механизм фреймворка это privileged hints, привилегированные подсказки. Дизайнер прикладывает к каждой среде подсказку h: набросок частичного решения или ключевое наблюдение о структуре задачи. Если показать такую подсказку решающему агенту, задача становится ощутимо легче.

Разрыв между наградой агента с подсказкой и без неё и есть regret, на который опирается награда дизайнера. Максимизируя этот разрыв, дизайнер учится строить задачи на грани возможностей агента, но при этом решаемые: там, где подсказка меняет исход, есть чему учиться. Задачи, которые агент и так решает без помощи, дают нулевой разрыв и не поощряются. Как и безнадёжно сложные, где подсказка уже ничего не меняет.

Получается, что подсказки заменяют ручную настройку сложности, из-за которой обычно и приходится держать команду людей, вручную калибрующих учебный план для каждой модели.

По сути это автоматическая версия curriculum learning: расписание сложности не пишут заранее, а выводят из поведения самого агента. Чем точнее дизайнер попадает в зону, где задача трудна, но решаема, тем сильнее растёт решатель.

В отличие от ручных расписаний сложности и бинарных фильтров «решаемо или нет», regret даёт непрерывную шкалу. Слишком лёгкие и безнадёжно сложные задачи отсекаются автоматически, а рабочая зона подстраивается под текущий уровень агента: чем дальше он продвигается, тем требовательнее становятся среды. Обе роли при этом исполняет один и тот же LLM, чередующий режимы дизайнера и решателя.

Что оказалось критично для результата

Аблации показали два обязательных компонента. Первый это привязка дизайнера к корпусу: он опирается на документы из большого предобучающего корпуса, и без этого среды скатываются в трафаретные формальные задачки. Второй это память по уже сгенерированным средам: она защищает от повторения одних и тех же задач и помогает удерживать разнообразие.

Полная адаптивная конфигурация обошла все частичные и неадаптивные варианты, а ширина учебной программы напрямую влияла на прирост. Чем больше типов навыков задействует дизайнер, тем выше итоговые результаты: разнообразие тренировки переносится на незнакомые задачи лучше, чем её глубина в одном узком месте.

Промежуточные конфигурации с частично обученным дизайнером, без привязки к корпусу или без памяти сред проигрывают полной версии на всех бенчмарках. Вклад каждого элемента проверяли отдельно, и лучший результат даёт именно адаптивная комбинация, а не какая-то одна деталь. Ограниченный вариант всего с двумя навыками проиграл широкой программе: решающим оказалось не количество задач, а разнообразие типов мышления, которое они тренируют.

Результаты: восемь бенчмарков и агентский рекорд

Эксперименты шли на трёх бэкбонах Qwen3: 4B, 8B и 30B-A3B. Дообучение через GRPO, 400 прогонов по 25 сред. Линейку составили восемь удержанных бенчмарков: AIME 2025 и 2026 (соревновательная математика), GPQA-Diamond (научные вопросы), LiveCodeBench-v6 (код) и четыре категории Reasoning-Gym (математика, алгоритмы, когнитивные навыки, логика).

Протокол оценки проверяет перенос в обе стороны: близкие к тренировке процедурные задачи Reasoning-Gym на высокой сложности и далёкие внешние тесты на математику, науку и код. Причём игровые среды и среды с инструментами тестировались как отдельные сценарии.

Сравнение шло с двумя фиксированными базами: синтетическим набором задач и RLVE с официальными настройками сэмплинга и учебного расписания. Сильнейшей из них оказался RLVE, и именно его SPADE обходит на 5,3 пункта на бэкбоне 30B-A3B. Проще говоря, выигрыш даёт адаптивная генерация сред, а не сам факт дополнительного дообучения на зафиксированном пуле задач.

На самом крупном бэкбоне средний балл вырос с 50,2 до 58,3. Это +8,1 пункта к базовой модели и +5,3 к сильнейшему фиксированному набору сред. Разбивка по отдельным тестам: GPQA-Diamond с 70,4 до 75,8, LiveCodeBench-v6 с 43,2 до 47,3, Reasoning-Gym по математике с 45,0 до 63,3, по алгоритмам с 18,0 до 32,1, по когнитивным навыкам с 23,0 до 37,7. Соревновательная математика почти не сдвинулась (с 61,5 до 62,8 и с 73,5 до 74,4), то есть метод не перекраивает профиль модели, а добавляет навыки процедурного уровня.

В сценариях с инструментами прирост получился самым заметным: +5,7 пункта на BFCL-v4 multi-turn и +13,9 на ACEBench-Agent. В игровых средах отрыв от фиксированных наборов растёт вместе с размером модели. Для проверки на чужом семействе авторы прогнали тот же рецепт на Nemotron-30B-A3B-BF16: динамика обучения воспроизвелась, значит метод не привязан к Qwen.

Что это значит для гонки самоулучшения

Джек Кларк в выпуске Import AI 470 описывает SPADE как грубую форму RSI-бутстрапа (recursive self-improvement, рекурсивное самоулучшение) через расширение данных. Логика простая: если среды генерирует сильная модель, собирать большие и разнообразные датасеты становится дешевле, а слабые модели получают более качественный сигнал для обучения.

Ограничение авторы формулируют прямо: бутстрап не выходит принципиально за пределы возможностей базовой модели-дизайнера. Работает это не потому, что модель придумывает невиданные задачи, а потому, что автоматизирует широкое покрытие уже понятных. Кларк добавляет практический трюк: можно чередовать разных фронтирных дизайнеров, чтобы поднять разнообразие сред без пересборки рецепта.

В терминах трендов это ещё один шаг к тому, что дизайн тренировочных сред переезжает из ручной работы в обучаемые компоненты. Вместе с RLVE, Reasoning Gym и похожими системами формируется отдельный стек инструментов вокруг сред для агентов: не бенчмарки ради отчётности, а генераторы сигнала, который улучшает модели.

Индустрия упирается в похожую стену. Текстовых данных в мире много, а вот интерактивных сред для агентов постоянно не хватает, и фронтир смещается к тому, кто быстрее и дешевле производит качественные среды. SPADE показывает, что производство сред само может стать обучаемой задачей, а не ручной работой.

Часто задаваемые вопросы

Что такое SPADE простыми словами?

SPADE это система, где одна языковая модель придумывает тренировочные задачи в виде кода, а потом сама же учится их решать. Подсказки помогают выставлять сложность: дизайнер получает больше награды за задачи, где подсказка меняет исход, но решение остаётся достижимым.

Чем это отличается от self-play, как в играх?

В классическом self-play правила игры фиксированы, и система просто улучшает стратегию. SPADE генерирует сами правила: каждая среда это программа с переходами состояний, наградами и проверкой решений. Обе роли в цикле обучаются: дизайнер ищет задачи на грани возможностей решателя, а решатель прогрессирует на них.

Это уже рекурсивное самоулучшение?

Не в полном смысле. Модель улучшает себя внутри сгенерированных сред, но сами среды ограничены возможностями модели-дизайнера: авторы прямо пишут, что бутстрап не выходит радикально за пределы её «воображения». Это работающий шаг к открытому самоулучшению, а не его завершённая форма.

Где посмотреть код и данные?

Статья SPADE: Self-Play in Adaptive Synthetic Executable Environments опубликована на arXiv (2608.19197). Код, конфигурации и чекпоинты лежат в открытом репозитории spade-rl на GitHub, включая модели Qwen3 после тренировки. Разбор Джека Кларка читайте в выпуске Import AI 470.

Итог

SPADE смещает фокус агентского обучения с алгоритмов на среды: генерировать их оказалось выгоднее, чем размечать руками. Подсказки дают дешёвую калибровку сложности, память сред удерживает разнообразие, а вместе это приносит +8,1 пункта к базовой модели и +13,9 пункта в агентском сценарии с инструментами.

Полный текст статьи лежит на arXiv (2608.19197), код и чекпоинты открыты в репозитории spade-rl на GitHub, а разбор Джек Кларка ждёт в выпуске Import AI 470. Если вы обучаете агентов и упёрлись в потолок фиксированных сред, начните с малого: добавьте к каждой тренировочной задаче короткую подсказку и измерьте разрыв между результатом с ней и без неё. Этот разрыв покажет, где проходит граница возможностей вашего агента.

← Все записи