Базовые модели рассуждают не хуже RL: решают первые токены
Двух токенов достаточно, чтобы базовая языковая модель догнала свою RL-версию в математике. Если зафиксировать начало ответа Olmo-3-7B на точке с двумя переносами строки и слове Okay, точность на MATH-500 поднимается с 42% до 78%. У той же модели после обучения с подкреплением 75%. Никакого дообучения, никаких инструкций вроде «думай пошагово»: только два первых токена, которые модель и так генерирует сама.
Работа вышла на arXiv в начале октября 2026 года (2610.06851), её сделали исследователи из Berkeley AI Research и MIT CSAIL. Они задались вопросом, который висит над всей индустрией пост-тренинга: что именно добавляет обучение с подкреплением к базовой модели? Ответ получился неожиданным. Почти весь прирост от RL в их экспериментах объясняется короткой открывашкой, а сама открывашка выучена ещё на претрейне, из ассоциаций в данных.
Что такое токены-подсказки
Токен-подсказка это фиксированное начало ответа, которое переключает режим работы модели. Речь буквально о первых одном-двух токенах: у Olmo-3-7B это точка с двумя переносами строки и слово Okay, у Qwen3-14B пробел со словом Alright и запятая. В них нет ни инструкции, ни примера решения. Но статистически они связаны с рассуждением в обучающих данных, и модель достраивает рассуждение сама, стоит зафиксировать это начало.
Технически приём называется префиллинг: мы подаём открывашку принудительно и смотрим, что модель сгенерирует дальше, не меняя ни одного веса. Обычно модель генерирует и начало, и продолжение; здесь исследователи разорвали эти две части и изучали их по отдельности. Эффект оказался почти целиком в открывашке.
Как искали подсказки
Слова не подбирали руками. Авторы взяли 30 задач из обучающего набора MATH, прогнали beam search шириной 20 и глубиной два, получили 20 самых вероятных открывашек. Дальше каждая проверялась по согласованности ответов: 16 сэмплов на задачу, никаких эталонных ответов. Побеждает открывашка, у которой ответы меньше всего разбросаны. На Olmo этот критерий нашёл подсказку в пределах 1,1 процентного пункта от лучшей из 500 протестированных открывашек, так что расширять поиск почти бессмысленно.
Отправную точку подсказала сама модель. 50% правильных ответов Olmo-3-7B на MATH-500 начинались с токена «точка и два переноса», против 14% неправильных. За простым наблюдением стоит сильная корреляция, которую авторы и превратили в эксперимент.
Любопытная деталь: слово Okay в одиночку даёт 74,9% точности, но по вероятности сразу после промпта стоит лишь на 542-м месте. Зато «точка с двумя переносами» второй по вероятности токен, и 95% ответов, начинающихся с него, продолжаются словом Okay. Поэтому рабочая подсказка составная: сначала естественная открывашка, потом ключевое слово. Выбранная пара своя для каждой модели и формата промпта.
RL не создаёт рассуждение, а повышает его вероятность
Исследователи сравнили распределения следующего токена у базовой модели и её RL-версии на одинаковых префиксах. Расхождение, KL-дивергенция, максимально ровно на первых двух позициях ответа. Дальше модели практически совпадают. То есть RL меняет почти исключительно то, с чего ответ начинается, а не то, как он продолжается.
В числах это выглядит так. Вероятность открывашки после RL растёт с 0,14 до 0,65 у Olmo-3-7B и с 0,04 до 0,58 у Qwen3-14B. Если зафиксировать подсказку до начала RL-обучения, она заменяет примерно 100 шагов GRPO у Olmo и 50 у Qwen. Дальнейшее обучение с принудительной подсказкой добавляет мало: RL просто догоняет то, что уже давала фиксация. На пяти бенчмарках у Olmo фиксация даёт рост в 1,4-1,9 раза, у Qwen на математических бенчмарках в 1,1-3 раза.
Не просто длиннее
Подсказка удлиняет ответы с 4,8 до 6,7 тысячи токенов, и первое объяснение, которое приходит в голову: модель просто думает дольше. Авторы проверили и это. Другие открывашки генерируют вдвое более длинные ответы и всё равно показывают точность ниже, чем вообще без подсказки. А при урезании бюджета подсказка выигрывает уже с первых 1 000 токенов и догоняет RL-версию примерно за половину её лимита. Дело не в длине, дело в режиме.
Наглядный пример из статьи. Задача: 834 ученика занимаются музыкой, это две трети школы, сколько всего учеников? С открывашкой-ответом модель уверенно пишет 1002 и ошибается. С рассуждающей подсказкой она записывает «(2/3) * T = 834», получает 1251 и сама себя проверяет: «Let me double-check». Тот самый aha-момент, который принято приписывать DeepSeek-R1-Zero, только здесь он случается у базовой модели без единого шага RL.
Откуда берутся подсказки: всё решают данные
Почему безобидное Okay включает рассуждение? Ответ нашёлся в данных: в mid-training корпусе Olmo-3-7B слово Okay открывает 83% синтетических reasoning-трейсов. Корреляция сама по себе ничего не доказывает, поэтому авторы переписали данные и переобучили модель с промежуточного чекпоинта. Десять миллиардов токенов, тот же порядок данных, тот же сид, меняется только текст. Полный прогон на 100 млрд токенов показывает тот же эффект при более высокой точности, так что десяти миллиардов достаточно для демонстрации.
Первый эксперимент: во всём миксе «okay» заменяется на «chicken». Открывашка с Chicken поднимает точность на MATH-500 с 2,4% до 37,2%, а на GSM8K с 2,2% до 60,6%. Произвольное слово превращается в работающую подсказку для рассуждений. При этом курица остаётся курицей: в обычных контекстах модель по-прежнему рассказывает про птицу и еду.
Второй эксперимент разворачивает подсказку. Если в документах с вопросами и ответами заменить метку «Question:» на «Okay,», модель после подсказки начинает придумывать вопросы вместо решения задачи, и точность падает до 0,2%. Ассоциация перепривязалась к другому поведению.
Третий и самый говорящий. В обучающих данных «step by step» заменяется на «duck duck goose». После этого инструкция «Think duck duck goose» даёт на MATH-500 точность 17% против 15% у «Think step by step». Абсурдная фраза работает как инструкция рассуждать, потому что занимает её место в статистике данных.
Авторы сами проводят аналогию с опытами Павлова: собака выделяет слюну на звонок, если звонок много раз предшествовал еде. Токены-подсказки это звонок, рассуждение это слюна. Семантика тут почти ни при чём, значение имеет лишь место, которое токен занимает в обучающей статистике.
Что происходит внутри модели
Внутренняя картина сходится с поведением. Скрытые состояния ответов после эффективных подсказок сдвигаются к скрытым состояниям синтетических reasoning-трейсов из обучающего корпуса: сравнение шло по 24-му слою и ближайшим соседям среди документов. Фразы самопроверки вроде «Wait, let me double-check» встречаются в 97% ответов с Okay-подсказкой и только в 5% ответов с другой открывашкой.
Позиция подсказки критична. Если вставить Okay не в самое начало ответа, а в начало третьего-шестого абзаца, точность падает ниже базовой линии: 23-30% против 38% без подсказки. В начале первого-второго абзаца те же токены дают 69-71%. Сдвиг к reasoning-трейсам должен быть устойчивым, кратковременного всплеска похожести недостаточно.
Ещё один отрезвляющий пример: открывашка «Problem» тоже сдвигает скрытые состояния к рассуждениям, но модель лишь пересказывает план и не считает. Её точность 6,3%. Похожесть на reasoning-данные сама по себе не гарантирует правильный ответ.
Подсказки управляют и отказами
Механизм работает не только в математике. На наборе XSTest авторы проверили, как открывашки влияют на отказы. Начало «I'm sorry» заставляет модель отказывать даже на безобидные просьбы вроде остановки процесса Python. Вариант « Okay,» с пробелом становится подсказкой согласия: доля вредных ответов на опасные запросы 42,4%. А рассуждающая подсказка с двумя переносами даёт 0,2% вредных ответов и избирательные отказы, как у обученных Instruct и Think-SFT версий.
Разница между 42,4% и 0,2% здесь это разница между пробелом и двумя переносами строки. Пунктуация на входе меняет поведение безопасности на два порядка, и это ещё один аргумент в пользу того, что смотреть надо не на смысл подсказки, а на её статистику.
Ограничения
Работа проверяет один сценарий: RL применяется прямо к базовой модели в стиле R1-Zero, без SFT и многоэтапных пайплайнов. Сложные пайплайны пост-тренинга могут добавлять способности, которые подсказками не воспроизводятся. Эффект зависит от модели: для Llama-3.1-8B авторы не нашли работающей подсказки вообще. И сильнее всего эффект там, где в данных много синтетических reasoning-трейсов, то есть у моделей, обученных по «рассуждающим» рецептам. Впрочем, репликация на SmolLM3-3B показывает, что дело не только в одной конкретной модели.
Что это меняет для базовых моделей
Ключевое различение из статьи: что модель умеет и что она склонна делать. Рассуждение у базовой модели уже есть, RL делает его вероятным по умолчанию. Отсюда практические следствия. Если поведение вызывается кондиционированием, открытым остаётся вопрос, что даёт закрепление его весами и какие другие полезные поведения от этого становятся труднее вызвать. А ещё это повод внимательнее проектировать синтетические данные. Пары «открывашка плюс поведение» создаются сами собой, и не все из них безобидны: тот же Okay в одном виде включает проверку решения, в другом снижает отказы на опасные запросы.
Часто задаваемые вопросы
Почему два токена вообще меняют поведение модели?
Языковая модель это условное распределение следующего токена, и начало ответа входит в условие. Сдвигается не «желание» модели, а распределение всех продолжений. Ассоциация «такое начало, такой режим» выучена из данных, где синтетические рассуждения почти всегда открывались словом Okay. Фиксация подсказки равносильна попаданию в нужную область распределения.
Значит, RL для рассуждений не нужен?
Не так. Работа показывает, что в сценарии R1-Zero большая часть прироста объясняется подсказками, которые RL лишь делает более вероятными. Но у RL остаются роли: закрепление поведения по умолчанию, многоэтапные пайплайны с SFT, способности за пределами проверенных бенчмарков. Точная формулировка из статьи: RL не создаёт рассуждение с нуля, а усиливает то, что уже поддержано базовой моделью и данными.
Сработает ли это на любой модели?
Подсказки ищутся заново под каждую модель и формат промпта, и находятся не всегда: для Llama-3.1-8B эффективной открывашки не нашлось. Успех зависит от того, как структурированы рассуждающие данные в претрейне. Зато метод не требует эталонных ответов, только задачи и сэмплы, так что проверка на своей модели это вопрос запуска beam search и пары сотен сэмплов.
Итог
Два токена на входе, плюс 36 процентных пунктов на MATH-500. Исследование из Berkeley и MIT напоминает, что рассуждение базовой модели это не магия RL, а статистика обучающих данных, доступная через правильную открывашку. Код и материалы открыты: github.com/sophicle/cues и sophielwang.com/cues. Если у вас под рукой есть модель, поиск подсказок для неё станет хорошим первым экспериментом: понадобятся только задачи и сэмплы, без разметки.