ИИ-учитель Sherpa: как LLM учится подстраиваться под ученика
Большие языковые модели стали сильными решателями задач, но объяснять решения они так и не научились. Ни одна из 16 фронтир-моделей не набрала даже 56% в экспертных рубриках тьюторинга, а исследования 2025 года показали, что готовые ответы от ИИ не превращаются в обучение и иногда снижают вовлечённость и самостоятельность. Пропасть между «умею решить» и «умею научить» попыталась закрыть команда исследователей из Стэнфорда, Georgia Tech и Carnegie Mellon. Их фреймворк Sherpa обучает модель преподавать так, чтобы ученик становился сильнее, а не чтобы объяснения выглядели красиво. Препринт вышел на arXiv 6 октября 2026 года под номером 2610.08778.
Что такое Sherpa
Sherpa это фреймворк многоходового обучения с подкреплением (multi-turn RL), который тренирует языковую модель в роли учителя. Модель ведёт диалог с учеником, а награду получает за один измеримый результат: прирост вероятности, что ученик самостоятельно решит задачу после урока. Заранее прописанных критериев «хорошего объяснения» в сигнале обучения нет вообще.
Почему учить сложнее, чем решать
Решать задачи и учить других это разные навыки, и второй не выводится из первого автоматически. Работа Macina et al. 2025 года показала, что сильные модели-решатели проваливают педагогические тесты, а в исследовании Srinivasa et al. ни одна из 16 фронтир-моделей не дотянула до 56% по экспертным рубрикам тьюторинга.
Подходы к обучению моделей-учителей развивались по трём линиям: обучение на демонстрациях хороших уроков, оптимизация по парам предпочтений и обучение с подкреплением на симулированных учениках. У всех общий изъян. Сигнал обучения кодирует заранее заданное представление о том, как выглядит хорошее преподавание, вместо того чтобы опираться на реальные результаты учеников.
Проблема в разнообразии. Одному ученику нужны наводящие вопросы, другому пошаговый разбор, третьему сравнение альтернативных подходов. Единый шаблон не может быть оптимальным для всех, а прописать критерии под каждый тип заранее невозможно. Sherpa переносит источник разнообразия на сторону ученика: разные потребности задаются в ученике, а учитель оптимизируется по факту прогресса.
Как устроен урок: подготовка, тьюторинг, тестирование
Каждый эпизод обучения проходит три стадии. Сначала подготовка: учитель приватно решает задачу и сохраняет черновик решения. Потом тьюторинг: диалог с учеником длиной до десяти ходов, причём учитель может завершить урок раньше. И наконец тестирование: ученик решает исходную задачу заново, а награда учителя равна разнице между вероятностью успеха после урока и без него. Вероятности оцениваются многократной проверкой: восемь попыток до урока и восемь после.
В экспериментах учителем была Qwen3-8B, учеником Qwen3-1.7B, маленькая модель, которая не справляется с задачами самостоятельно (её базовая точность 36%). Задачи взяли из датасета MATH и отфильтровали так, чтобы учитель точно владел решением, а ученик имел пространство для роста. Осталось 759 задач для тренировки и 528 для оценки.
Обучение шло через critic-free RL алгоритм на фреймворке AReaL: до 64 параллельных роллаутов, по восемь траекторий на задачу, 1500 обновлений, LoRA-адаптеры ранга 16. Генерация шла при температуре 1.0, у учителя было до трёх попыток подготовки по 4096 токенов, а задача пропускалась, если ни одна из них не дала верного решения. Черновик решения оставался в контексте учителя на протяжении всего урока. Это не мелочь: абляция показала, что без приватной подготовки точность учеников падает на 3,3 процентных пункта.
Два гейта: не подсказать ответ и попасть в потребности
Главная инженерная идея Sherpa это два гейта, которые фильтруют поведение учителя во время урока. Первый, guidance gate, запрещает раскрывать финальный ответ или эквивалентное выражение. Учитель обязан вести к решению, оставляя ученику место для собственных шагов. Проверяет соблюдение отдельный судья, снова Qwen3-8B. Награда присваивается только ходам, прошедшим оба гейта, а за битые и повторяющиеся ответы начисляется отдельный штраф. Схема отличается от привычной альтернативы, где судья оценивает урок целиком: широкие оценки либо пропускают локальную утечку ответа в одной реплике, либо штрафуют законные подсказки вроде промежуточных вычислений. Гейт проверяет каждый ход отдельно и отсеивает его до того, как тот дойдёт до ученика.
Второй, adaptive gate, отвечает за попадание в потребности конкретного ученика. Ученик здесь не абстрактный собеседник, а один из семи архетипов: None без предпочтений, Attempt (поддержка собственных попыток), Subgoal (разбивка на подцели), Contrast (сравнение подходов), Causal (объяснение причин), Step (пошаговый разбор) и Verification (проверка выводов).
Учитель не видит тип ученика напрямую и выводит его из реплик по ходу диалога. Гейт отсеивает ходы, не подходящие под выведенные потребности: отклонённые реплики не попадают в контекст ученика и не влияют на награду. Тренировка шла на четырёх архетипах, а три остальных (Causal, Step, Verification) остались для проверки на незнакомых типах учеников.
Отдельный тест сравнил архетипы с учениками, у которых предпочтения прописаны прямо в промпте. Учителем в нём была GPT-5.6-Luna с одной из шести фиксированных стратегий, и матрица «шесть на шесть» показала разницу: у архетипов прирост концентрируется на совпадающих парах «учитель-ученик», а жалобы на неподходящие объяснения возникают реже. У прописанных учеников ни одного из этих эффектов нет. Значит, гейты действительно создают разные потребности, а не имитируют их на словах.
Результаты: +20 пунктов к точности учеников
После уроков Sherpa средняя точность учеников выросла с 48,6% до 69,0%. Для сравнения: тот же учитель без обучения даёт 48,6%, метод PedagogicalRL набирает 52,7%, а вариант Sherpa, обученный на одном типе ученика, останавливается на 52,0%.
Разница между вариантами обучения оказалась интереснее абсолютных чисел. Учитель, тренировавшийся на четырёх разных архетипах, обошёл «однотипного» коллегу на каждом типе ученика: на Attempt 78,2% против 58,8%, на Subgoal 72,7% против 52,0%. Разнообразие учеников в тренировке определило результат не меньше, чем сам сигнал награды.
Прогресс распределился неравномерно. На знакомых архетипах средняя точность 72,0%, на незнакомых 65,1%. Переход от однотипного обучения к разнообразному особенно заметен на сложных архетипах: Causal вырос с 55,1% до 77,1%, Step с 40,6% до 51,8%. Даже 51,8% для Step это лучший результат среди всех проверенных моделей, но самый скромный среди архетипов.
MathTutorBench: 79,2% против 52,5%
Внешняя проверка на MathTutorBench подтвердила, что дело не в подгонке под собственный симулятор. Бенчмарк покрывает три группы навыков: математическую экспертизу, понимание ученика и генерацию ответов учителя. По средней педагогической оценке Sherpa набирает 79,2% против 52,5% у базовой модели и 63,2% у PedagogicalRL.
Самый заметный сдвиг в следовании инструкциям: доля побед (win rate) выросла с 74,0% до 90,3% в стандартных задачах и с 70,6% до 87,2% в усложнённых. Скаффолдинг, умение дать опору без готового ответа, поднялся с 33,1% до 72,0%. Есть и побочный эффект: точность локализации ошибок ученика упала с 37,1% до 30,3%, а качество сократических вопросов снизилось с 25,3% до 21,9%. Авторы называют это ценой специализации, хотя по локализации ошибок Sherpa всё равно опережает PedagogicalRL (30,3% против 18,7%).
Человеческая оценка: 79,6% побед
Финальная проверка сравнила модели с людьми. Участников исследования (набирали через Prolific) просили выбрать лучший ответ в парах «обученный учитель против базового». Обученная модель победила в 79,6% сравнений без учёта ничьих: 728 голосов против 187 у базовой версии при 45 ничьих. Преимущество держится на всех четырёх проверенных предпочтениях, от 75,6% до 85,5%, включая два типа учеников, которых учитель не видел при обучении. Динамика обучения тоже отличается: у PedagogicalRL большая часть прогресса по метрике утечки приходится на первые 200 обновлений, а у Sherpa проходимость гейтов растёт постепенно, и авторы связывают это с лучшей генерализацией.
Отдельный эксперимент бьёт в ту же точку. Если добавить к награде штрафы за отход от заранее заданных педагогических критериев, качество падает: штраф 0,25 снижает оценку MathTutorBench с 79,2% до 70,6%, штраф 0,5 до 66,0%. Чем сильнее обучение привязано к прописанным правилам, тем хуже модель учит. Сигнал из реального прогресса ученика обыгрывает прокси-метрики.
Что это значит
Ограничения у работы очевидны. Всё проверено только на математике и только на учениках-моделях: Qwen3-1.7B удобный, но не живой студент, и переносить выводы на школьников без отдельных исследований нельзя. Авторы оговаривают и другую сложность: реальные ученики могут не осознавать собственные предпочтения, и тогда учителю придётся выводить их постепенно, по ходу взаимодействия.
Методологический сдвиг здесь важнее цифр. Sherpa показывает рабочую альтернативу привычной схеме, где обучение оптимизируется по прокси-метрике. Подмена цели метрикой (reward hacking) начинается там, где сигнал награды расходится с тем, что мы хотим получить на самом деле, и в образовании цена такой подмены особенно высока: речь о том, сохранит ли человек способность думать самостоятельно. Подход с наградой за прирост ученика переносим далеко за пределы педагогики, в любое обучение агентов, где важен конечный эффект, а не соответствие чек-листу. Для образовательных продуктов это меняет приоритеты разработки: вместо ручной настройки промптов и рубрик под «идеальный урок» можно строить цикл, где сигналом служат измеримые результаты учеников, а требования к преподаванию задаются на стороне симуляторов и обновляются независимо от модели-учителя.
Часто задаваемые вопросы
Sherpa заменит живых учителей?
Нет, и цель у авторов обратная. Модель нужна, чтобы усиливать понимание человека, а не выдавать готовые ответы. Учителя в исследовании оценивали по приросту самостоятельности ученика, а не по красоте подсказок. В выводах прямо сказано: работа приближает использование LLM для поддержки реальных студентов, а не для их замены.
Почему эксперименты только по математике?
Математика удобный полигон: учитель заведомо владеет материалом, а ответы ученика проверяются автоматически. Из датасета MATH отобрали 759 задач для обучения и 528 для оценки, отбросив всё, что ученик решает сам или не осилит учитель. Расширение на другие предметы авторы оставляют будущим работам.
Что такое архетипы учеников?
Это семь моделей поведения с разными потребностями: от ученика без предпочтений до любителя подцелей, сравнений или проверок. Каждый тип реализован через гейт, который пропускает только подходящие инструкции учителя. Так исследователи получают разнообразие для тренировки, не собирая реальных студентов.
Итог
Sherpa это не про замену учителей, а про то, как учить модели учить. Награда за прирост ученика вместо красивых объяснений подняла точность с 48,6% до 69,0%, педагогическую оценку с 52,5% до 79,2%, а живые оценщики выбрали обученную модель в 79,6% сравнений. Проверить принцип можно на себе: в следующий раз попросите ИИ не решать задачу за вас, а провести вас к ответу вопросами и подсказками. Разница в понимании чувствуется сразу.