ES vs GRPO: как эволюция лечит коллапс энтропии LLM
Модель смещает свои веса в 44 раза дальше от исходного состояния, чем при обучении с подкреплением, и при этом не забывает ничего из того, что знала. Звучит как противоречие, но именно это доказывает свежая работа «Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO» от команды Янга Пэнга Бао. Статья бьёт по самому болезненному месту современного пост-тренинга: GRPO, индустриальный стандарт для обучения рассуждению, вызывает коллапс энтропии, а старые добрые эволюционные стратегии (Evolution Strategies, ES) этот коллапс лечат.
Что такое эволюционные стратегии применительно к LLM
Эволюционные стратегии, это метод оптимизации нулевого порядка: вместо градиентов через backpropagation создаётся популяция «клонов» модели, каждый получает небольшое случайное гауссово возмущение весов, все оцениваются на задаче, и центральная модель смещается в сторону взвешенной комбинации самых успешных возмущений. Никаких градиентов, никаких состояний оптимизатора, только прямые проходы и награды.
До недавнего времени ES воспринимались в мире LLM как трюк для экономии памяти: раз не нужно хранить optimizer states, можно тренировать модель там, где Adam не влезает в VRAM. Новая работа показывает, что это не просто хак для слабого железа, а математически отдельная парадигма обучения, которая по качеству рассуждений превосходит GRPO.
Проблема: как GRPO убивает разнообразие рассуждений
GRPO (Group Relative Policy Optimization) стал де-факто стандартом для reinforcement learning with verifiable rewards: математика, код, всё, где ответ можно проверить. Механика проста: модель генерирует группу ответов, вычисляются относительные преимущества внутри группы, и токен-уровневые обновления проталкиваются через ту же самую политику.
Проблема спрятана в математике этого процесса. Когда высоковероятные действия стабильно получают положительную награду, ковариация между вероятностью действия и его преимуществом становится положительной, и это математически вынуждает энтропию политики падать. Модель гиперфиксируется: она становится отличной в pass@1, выдаёт правильный ответ с первой попытки, но если попытка провалилась, дальше пустота. Попросите её сгенерировать 16 или 32 альтернативных пути решения, и она не найдёт ничего нового, потому что вся вероятностная масса сконцентрирована на одной узкой траектории.
Эмпирика это подтверждает жёстко. Авторы прогнали эксперименты на GSM8K с моделями Qwen 1.5B, 3B и 7B, а также на DeepScaleR с DeepSeek-R1-Distill 1.5B. Результат: GRPO улучшает pass@1, но часто опускается ниже базовой модели на pass@16 и pass@32. То есть после обучения с подкреплением модель становится функционально хуже в поиске правильного ответа, если у неё есть несколько попыток. Это как студент, который вызубрил одну формулу под конкретный экзамен: на первой задаче блестит, а если формула не подошла, просто бланкует.
Как ES сохраняет покрытие рассуждений
ES решает задачу иначе. Если GRPO это один студент, затачивающий один путь, то ES это 16 клонов студента, каждому из которых слегка изменили «план подготовки» (случайное возмущение параметров). Все клоны решают задачи, чей результат лучше, чья «нейронная проводка» сильнее влияет на следующую итерацию центральной модели.
Ключевой теоретический результат статьи опирается на метрику, которую авторы называют verifier-projected Jensen-Shannon diversity. Дивергенция Дженсена-Шеннона измеряет, насколько различаются два распределения вероятностей. Авторы математически доказывают, что малые возмущения параметров в ES порождают не случайный токенный шум на выходе, а genuinely различные, валидные пути рассуждения. Разные члены популяции действительно имеют разные распределения ответов. Когда награды взвешиваются по такой разнообразной популяции, центральная модель смещается в направлении, которое сохраняет множество путей, вместо коллапса в одну высоковероятную последовательность.
Эмпирически ES не только улучшает pass@1 относительно базовой модели, но и достигает значительно более высоких pass@16 и pass@32, чем GRPO. Модель сохраняет гибкость решать задачу с нескольких сторон.
44-кратный дрейф параметров без катастрофического забывания
Самый контринтуитивный результат статьи касается того, насколько сильно ES меняет модель. Измеренное по относительной L2-дистанции, ES-модели уходят от исходных весов в 40.7–44.1 раза дальше, чем GRPO-модели. Классическая интуиция говорит: такой дрейф должен уничтожить foundational knowledge, модель должна потерять всё, кроме математики, под которую её оптимизировали.
Статья математически разбирает это допущение через концепцию magnitude sparsity. При анализе распределения изменений параметров выяснилось, что от 77.6% до 93% обновлений имеют микроскопические величины. Реальные значимые изменения сконцентрированы в очень разреженном подмножестве параметров, и это структурные компоненты: layer norm и attention projections, то есть «маршрутизация» модели, а не embeddings и logits, где живут знания и конкретные выходы. GRPO же агрессивно переписывает токенные logits ради математических баллов, и это деградирует общие способности сильнее, чем маршрутные корректировки ES. Большой дрейф параметров не равен широкому функциональному изменению.
Обратный scaling law: чем больше модель, тем меньше популяция
Здесь авторы нашли закономерность, которая поначалу кажется перевёрнутой. По мере роста размера предобученной модели требуемый размер ES-популяции уменьшается. Для модели 0.5B параметров стабильное обучение требовало популяцию из 32 особей. А вот для 1.5B и 3B популяция всего из 16 клонов давала почти ту же траекторию награды, что и массивная популяция из 64.
Объяснение связано с гипотезой лотерейного билета: большие плотные сети содержат в себе меньшие высокоэффективные подсети. В больших моделях концентрация таких «экспертов под задачу» вокруг предобученных весов плотнее. Случайное гауссово возмущение в 3B-модели с гораздо большей вероятностью наткнётся на полезную подсеть, чем в 0.5B-модели. Практический вывод приятный: вычислительные требования ES растут сублинейно относительно размера популяции по мере движения к фронтирным моделям.
Почему двухточечный оценщик бесполезен для рассуждений
В классической оптимизации нулевого порядка инженеры используют двухточечный оценщик: оценивают положительное возмущение, затем его зеркальную противоположность, и вычитают результаты, чтобы подавить дисперсию. Авторы показывают: для задач рассуждения это даёт ровно ноль преимущества.
Причина в авторегрессивной природе генерации. Если отрицательное возмущение заставляет модель на третьем токене выдать «однако» вместо «следовательно», вся остальная последовательность расходится. Это эффект бабочки: к десятому токену две зеркальные версии уже решают задачу по разной логической структуре, и вычитать их награды бессмысленно. Авторегрессивный шум разрушает парную ковариацию между симметричными возмущениями. Простой одноточечный оценщик, одна оценка на возмущение, работает так же хорошо, и это мгновенно вдвое сокращает требуемое число прямых проходов.
Из практических деталей статья выделяет ещё одну нерушимую вещь: Z-score нормализацию наград внутри популяции. Награды нужно стандартизировать в каждом батче, чтобы обновление опиралось на относительное качество клонов, а не на абсолютные шкалы наград.
ES и GRPO не конкуренты, а последовательность
Естественный вопрос инженера: а если GRPO затачивает pass@1, а ES сохраняет pass@k, почему бы не запустить их по очереди? Авторы протестировали оба пайплайна: сначала ES, затем GRPO, и наоборот. Методы не перезаписывают друг друга, потому что работают на разных механических уровнях, и вместе расширяют Парето-фронт pass@1 против pass@k.
Метафора здесь точная: ES сначала строит широкую систему магистралей в параметрах модели, разнообразную маршрутизацию. Затем GRPO оптимизирует конкретные токенные logits, чтобы «машины ехали быстрее» по уже построенным дорогам. На связке сложных бенчмарков (AIME 2024, AIME 2025, AMC 2023, MATH-500) последовательность «ES, затем GRPO» дала наивысший pass@32 среди всех методов, сохранив большую часть агрессивных pass@1-выигрышей GRPO. А вот на задачах общих знаний вроде GPQA с Llama 3B лучший промежуточный компромисс дал обратный порядок, «GRPO, затем ES». Порядок стоит подбирать под конкретную задачу деплоя.
Почему pass@k вообще важен
Метрика pass@k часто воспринимается как академическое украшение, но у неё есть очень практический смысл. В реальных пайплайнах модель редко работает в одиночку: best-of-n сэмплирование с верификатором, агентные сценарии с самопроверкой, tree search по рассуждениям, всё это опирается на способность модели генерировать разные, но валидные пути к ответу. Если политика сколлапсировала в одну траекторию, никакой внешний верификатор не спасёт: ему просто нечего выбирать. Именно поэтому падение pass@16 и pass@32 ниже уровня базовой модели после GRPO это не косметический дефект, а прямое ограничение на архитектуры вывода, которые строятся поверх reasoning-моделей.
Что изменилось с 2017 года
Эволюционные стратегии пробовали применять к нейросетям ещё в 2017 году, когда OpenAI опубликовала работу Салиманса и коллег о ES как альтернативе RL. Тогда метод показал конкурентоспособность на Atari и в робототехнике, но проиграл градиентным методам по удобству: backpropagation давал более плотный сигнал, а ES казался грубым поиском вслепую. С LLM ситуация перевернулась. Награда здесь разреженная и верифицируемая, решил или не решил задачу, а полные градиенты через длинные цепочки рассуждений дороги и шумны. Популяционный поиск в таких условиях оказывается не компромиссом, а преимуществом: он исследует пространство параметров шире, чем любой градиентный метод, ограниченный локальной геометрией одной политики.
Ограничения и открытые вопросы
У статьи есть и честные границы. Все эксперименты проведены на моделях до 7B параметров и на задачах с чёткой верификацией, математика и код. Остаётся открытым, как ES поведёт себя на фронтирных моделях в сотни миллиардов параметров, где даже один прямой проход популяции из 16 особей требует серьёзной инфраструктуры, и на задачах без автоматического верификатора, где награду приходится получать от reward-модели или человека. Второй открытый вопрос касается стабильности: популяционный поиск чувствителен к гиперпараметрам возмущений, и статья не даёт универсального рецепта их подбора под новую модель, кроме найденного scaling law по размеру популяции.
Часто задаваемые вопросы
ES заменит GRPO в продакшен-пайплайнах?
Полностью вряд ли. GRPO даёт максимальный pass@1 и быстрее сходится на узких верифицируемых задачах. Рабочий вариант, который показывает статья, это последовательность «ES, затем GRPO»: сначала популяционный поиск строит разнообразие маршрутизации, затем RL затачивает точность первого ответа.
Насколько дорого оценивать популяцию из 16 LLM?
Дешевле, чем кажется. ES требует только прямых проходов, без градиентов и состояний оптимизатора, а одноточечный оценщик вдвое сокращает число оценок. Плюс обратный scaling law: для больших моделей достаточно популяции из 16 вместо 64.
Почему дрейф в 44 раза не ломает модель?
Потому что 77.6–93% обновлений микроскопичны, а значимые изменения концентрируются в layer norm и attention projections, слоях маршрутизации. Знания в embeddings остаются нетронутыми, поэтому катастрофического забывания не происходит.
Итог
Эволюционные стратегии выходят из тени «трюка для экономии памяти» и становятся самостоятельной парадигмой пост-тренинга: они сопротивляются коллапсу энтропии, сохраняют покрытие рассуждений для pass@k, безопасно дрейфуют параметры за счёт magnitude sparsity и эффективно масштабируются на больших моделях. Авторы заканчивают провокационной мыслью: если ES меняет маршрутизацию, а RL меняет выходы, возможно, будущие архитектуры будут физически разделять эти фазы обучения. Заморозить embeddings, чтобы защитить знания, и гонять ES только по маршрутным слоям, обучая модель тому, как думать, а не что говорить. Это напоминает разделение fluid и crystallized intelligence в человеческом мозге, и это хороший повод пересмотреть свой следующий пост-тренинг пайплайн.