ISO: оптимизация для RLVR, которая экономит 88% веса модели

ISO: оптимизация для RLVR, которая экономит 88% веса модели

Когда исследователи из HKUST и Alibaba изучали, что происходит с весами языковых моделей во время reinforcement learning с верифицируемыми наградами (RLVR), они обнаружили странную вещь. Модель учится решать новые задачи — например, проходить олимпиадную математику или генерировать код, — но её сингулярные значения (спектр весов) почти не меняются. Новые способности приобретаются через поворот входных и выходных сингулярных фреймов, а не через изменение масштаба внутренних представлений.

Это наблюдение легло в основу Isospectral Optimization (ISO) — оптимизационного фреймворка, который не просто ускоряет обучение, а переосмысливает саму геометрию обновления весов. Вместо того чтобы двигать все 7 миллиардов параметров, ISO фиксирует спектр (сингулярные значения) и адаптирует только ортогональные фреймы — подпространства, в которых живёт информация. Результат: offline-версия объединяет трёх экспертов без дополнительных вычислений и даёт до +6.0% на бенчмарках, online-версия прибавляет +12.7 очков на AIME26 при одновременном 88% сжатии модели.

Что такое спектральное наследование

Любая матрица весов W в нейросети может быть разложена через сингулярное разложение (SVD): W = UΣV^T, где U и V — ортогональные матрицы (сингулярные фреймы), а Σ — диагональная матрица сингулярных значений (спектр). Спектр определяет масштаб внутренних представлений — насколько сильно модель усиливает или ослабляет сигналы на каждом слое. Сингулярные фреймы определяют направление — какие паттерны входных данных активируют какие выходные паттерны.

Исследователи проанализировали переходы SFT → RLVR у нескольких моделей (Qwen2.5-14B → DeepSeek-R1-Distill-Qwen-14B, Qwen3-14B → Nemotron-Research-Reasoning-Qwen-14B) и обнаружили: сингулярные значения остаются близки к базовой модели, а сингулярные фреймы поворачиваются. Это значит, что RLVR не создаёт принципиально новые внутренние представления — он переиспользует масштабы базовой модели и адаптирует направления.

Авторы назвали это явление spectral inheritance (спектральное наследование). Базовая модель уже знает, как масштабировать информацию — RLVR только учится направлять эту информацию иначе для решения новых задач.

Почему обычные оптимизаторы не видят эту структуру

Adam и его вариации (AdamW, Lion, Sophia) обновляют каждый параметр независимо, основываясь на градиентах и движущихся средних. Они не знают про сингулярную структуру весов и не могут явно зафиксировать спектр или адаптировать только фреймы. В результате оптимизатор тратит ёмкость на изменение спектра, который на самом деле должен оставаться стабильным, — это приводит к перезабуванию базовых способностей и неэффективному использованию параметров.

ISO решает эту проблему через явную параметризацию. Вместо хранения полной матрицы W модель хранит U, Σ₀ (фиксированный спектр базовой модели) и V. Во время обучения обновляются только U и V — ортогональные матрицы, которые определяются через матричную экспоненту от кососимметричных матриц: U = exp(A)U₀, где A — обучаемый параметр. Спектр Σ₀ остаётся замороженным.

Это даёт два преимущества. Первое — индутивнаяBias (inductive bias): мы явно говорим модели, что масштаб представлений менять не нужно. Второе — параметрическая эффективность: вместо d_out × d_in параметров для полной матрицы ISO работает с d_out² + d_in² параметрами для фреймов (при d_out = d_in = d это 2d² вместо d², но с дополнительными ограничениями на ортогональность).

Две инстанциации ISO

ISO-Merger — offline-версия для композиции экспертов. Представьте ситуацию: у вас есть базовая модель и три RLVR-эксперта, каждый из которых специализируется на своей задаче (код, инструменты, память). Обычное model merging (TIES, DARE, linear merge) усредняет веса экспертов, что приводит к интерференции — эксперты мешают друг другу. ISO-Merger вместо этого берёт спектры из базовой модели, а сингулярные фреймы из экспертов, и строит композицию через повороты. Результат — модель, которая сохраняет способности всех трёх экспертов без дополнительных rollouts или данных.

ISO-Train — online-версия для RLVR-обучения. Модель параметризуется через ISO с фиксированным спектром, и обучение идёт через градиенты по ортогональным фреймам. Обратное распространение ошибки проходит через матричную экспоненту и проекцию на касательное пространство ортогональной группы — математически сложнее, но практически реализуемо через автоматическое дифференцирование (JAX, PyTorch).

Эксперименты: offline merging

Авторы тестировали ISO-Merger на двух настройках. Первая — Qwen2.5-7B-Instruct как база, три эксперта: CURE (кодирование), ToolRL (использование инструментов), MemAgent (долгосрочная память). Вторая — DeepSeek-R1-Distill-Qwen-7B как база, три эксперта: CURE, ToolRL, и агент для long-context.

Результаты на Qwen2.5-7B setting:

LiveCodeBench (июль 2025 — январь 2026): ISO-Merger достигает +4.9% относительно базы (с 13.3% до 14.0% в абсолютных числах, но это +4.9 процентных пункта относительно базы). Это лучше, чем TIES-Merging (+2.3%), DARE-TIES (+2.0%), и даже on-policy distillation (+3.8%), которая требует дополнительных rollouts.

AIME 2025 (олимпиадная математика): +2.8% над базой. Для сравнения, линейное усреднение даёт +1.5%, а on-policy distillation — +2.1%.

IFEval (следование инструкциям): +6.0% — самый большой прирост. Это говорит о том, что композиция экспертов особенно полезна для задач, где нужно комбинировать разные способности.

Важный момент: ISO-Merger не требует данных для объединения. On-policy distillation, напротив, нужна выборка rollout'ов от каждого эксперта и последующая дообучение на этих данных. ISO-Merger работает только со весами — это делает его применимым к моделям, у которых нет доступа к данным обучения экспертов.

Эксперименты: online RLVR training

ISO-Train тестировался на DeepSeek-R1-Distill-Qwen-7B с бенчмарками AIME 2025, AIME 2026, LiveCodeBench, и другими.

Результаты впечатляющие:

AIME 2026: ISO-Train достигает +12.7 очков относительно базы (с 47.5 до 60.2). Стандартный GRPO (Group Relative Policy Optimization, используемый в DeepSeek-R1) даёт только +6.8 очков. Разница +5.9 очков в пользу ISO.

LiveCodeBench: +1.6 процентных пункта над базой, тогда как GRPO даёт +0.9%. ISO выигрывает +0.7 пункта.

При этом ISO-Train использует только 12% параметров для обновления (ортогональные фреймы), тогда как GRPO обновляет все 100% параметров. Это означает, что ISO не только эффективнее по данным, но и по параметрам.

Авторы также протестировали комбинацию ISO-Train с квантизацией: ISO-Train-Q4 (4-бит квантизация весов) даёт +10.1 очков на AIME26 — всего на 2.6 очка меньше, чем полная точность, но при 88% сжатии модели. Это практический результат: можно развернуть reasoning-модель на оборудовании с ограниченной памятью без катастрофической потери качества.

Почему это важно для scaling laws

Isospectral Optimization указывает на фундаментальное свойство RLVR: новые способности приобретаются через переориентацию существующих представлений, а не через создание новых масштабов. Это значит, что базовая модель уже содержит большую часть необходимой структуры — RLVR только адаптирует направления.

Для scaling laws это имеет два следствия. Первое — эффективность обучения: если мы можем зафиксировать спектр и адаптировать только фреймы, то параметрическая ёмкость используется более целенаправленно. Это потенциально снижает количество данных и вычислений, необходимых для приобретения новых способностей. Второе — композиционность: ISO-Merger показывает, что эксперты могут быть объединены без потери специализации, потому что их спектры совместимы (оба наследованы от базовой модели). Это открывает путь к модульному построению reasoning-моделей: обучить отдельных экспертов, а затем объединить их через ISO.

Практическое применение: когда использовать ISO

ISO не заменяет стандартное RLVR-обучение — он дополняет его в специфических сценариях. Вот три случая, где ISO даёт максимальную выгоду.

Сценарий 1: Композиция экспертов без данных. У вас есть команда, которая обучила трёх экспертов (кодирование, поиск, рассуждение) на разных датасетах. Вы хотите объединить их в одну мультимодальную модель. Обычное merging (TIES, DARE) усредняет веса и теряет специализацию. On-policy distillation требует rollout'ов от каждого эксперта и дообучения. ISO-Merger работает только со весами — вам не нужны данные, инфраструктура для rollout'ов, или доступ к training pipeline экспертов. Это особенно полезно для открытых моделей, где вы не знаете, на каких данных обучались эксперты.

Сценарий 2: Ограниченная память для развертывания. Вам нужно развернуть reasoning-модель на оборудовании с 24GB VRAM, но полноценная 7B-модель занимает 14GB в FP16. ISO-Train-Q4 сжимает модель до 4 бит (88% сжатие) при потере только 2.6 очков на AIME26 (12.7 → 10.1). Для сравнения, стандартная квантизация (GPTQ, AWQ) без ISO даёт потерю 5-8 очков при том же сжатии, потому что не учитывает спектральную структуру.

Сценарий 3: Перенос способностей между доменами. Вы обучили модель на медицинских вопросах и хотите добавить способность к юридическому рассуждению. Стандартное fine-tuning на юридических данных может перезабыть медицинские способности (catastrophic forgetting). ISO-Train фиксирует спектр базовой модели, что ограничивает изменения масштаба представлений — это снижает forgetting. На практике это означает, что модель сохраняет медицинские способности даже после обучения на юридических данных.

Сравнение с другими методами оптимизации

Как ISO соотносится с другими подходами к эффективному обучению? Рассмотрим три альтернативы.

LoRA/QLoRA добавляют низкоранговые матрицы к замороженным весам. Это эффективно по параметрам (обновляется только 1-5% веса), но позволяет спектру меняться. ISO же фиксирует спектр и адаптирует фреймы — это другая индутивнаяBias. В экспериментах авторов ISO-Train превосходит LoRA на AIME26 на +3.4 очка, потому что LoRA тратит ёмкость на изменение спектра, который должен оставаться стабильным.

DoRA (Weight-Decomposed Low-Rank Adaptation) разделяет веса на magnitude и direction, адаптируя их независимо. Это ближе к ISO, но DoRA работает на уровне отдельных слоёв, а ISO — на уровне всей модели. ISO также явно использует SVD базовой модели, тогда как DoRA не учитывает спектральную структуру.

Full fine-tuning обновляет все параметры. Это даёт максимальную гибкость, но тратит ёмкость на изменение спектра. ISO-Train при 12% параметров превосходит full fine-tuning на +5.9 очков AIME26, потому что фокусирует ёмкость на том, что действительно важно — направлении представлений, а не их масштабе.

Часто задаваемые вопросы

Чем ISO отличается от LoRA или других адаптеров?

LoRA добавляет низкоранговые матрицы к замороженным весам: W_new = W_0 + BA, где B и A — низкоранговые факторы. ISO же не добавляет, а пере параметризует существующие веса через SVD: W_new = exp(A)U_0 Σ_0 V_0^T exp(B). Лока фиксирует спектр Σ_0, а не сами веса W_0. Это даёт другую индутивнуюBias: ISO явно сохраняет масштаб представлений, тогда как LoRA позволяет спектру меняться (поскольку W_0 + BA имеет другой спектр, чем W_0). В экспериментах ISO-Train превосходит LoRA на +3.4 очка AIME26 при меньшей параметрической ёмкости (12% vs 1-5% для LoRA, но ISO использует ёмкость более целенаправленно).

Можно ли применять ISO к моделям, отличным от трансформеров?

В принципе да, если веса могут быть разложены через SVD (а это верно для любых матриц). Однако ISO разработан и протестирован specifically для трансформерных моделей с линейными слоями. Применение к CNN, RNN, или Mamba потребует дополнительной адаптации и проверки, что спектральное наследование действительно имеет место в этих архитектурах. Для Mamba (state space models) спектральная структура может отличаться, потому что SSM используют непрерывные параметры (A, B, C матрицы), а не дискретные веса.

Насколько практичен ISO-Train для больших моделей (70B+)?

ISO-Train требует вычисления SVD во время обучения (для реконструкции весов из фреймов и спектра). Для больших моделей это может быть дорого, особенно если делать SVD на каждом шаге. Авторы упоминают, что спектр можно обновлять менее часто (например, раз в N шагов), но полный масштаб экспериментов на 70B+ моделях в статье не представлен. ISO-Merger, напротив, требует однократного SVD для каждого эксперта — это практически применимо даже к большим моделям. Для 70B модели SVD занимает ~10 минут на A100 — это приемлемо для offline merging, но может быть дорого для online обучения, если делать SVD на каждом шаге.

Как ISO влияет на скорость инференса?

ISO-Train и ISO-Merger не влияют на скорость инференса — после обучения модель имеет ту же архитектуру, что и базовая. Единственное отличие — квантизация (ISO-Train-Q4) уменьшает размер модели и ускоряет инференс на ~2x за счёт 4-битных операций. Однако ISO-Train требует额外的 вычислений во время обучения (SVD, матричная экспонента), что увеличивает training time на ~15-20% по сравнению с стандартным GRPO.

Итог

Isospectral Optimization предлагает новый взгляд на то, как языковые модели приобретают новые способности через reinforcement learning. Вместо того чтобы двигаться в полном пространстве параметров, ISO фиксирует спектр весов и адаптирует только сингулярные фреймы — подпространства, в которых живёт информация. Результат: offline-объединение экспертов без данных (+4.9% LiveCodeBench, +6.0% IFEval), online-обучение с +12.7 очками на AIME26 при 88% сжатии модели.

Для практиков это означает два практических вывода. Первый — ISO-Merger позволяет комбинировать специализированных экспертов (код, инструменты, память) в одну модель без дополнительных вычислений или данных. Второй — ISO-Train показывает, что reasoning-модели можно обучать более эффективно, если явно указать оптимизатору, что спектр менять не нужно.

Исследование также поднимает фундаментальный вопрос: если RLVR переиспользует спектры базовой модели, то насколько сильно базовая модель определяет天花板 для reasoning-способностей? Это направление для будущих работ, но уже сейчас ISO предлагает практический инструмент для более эффективного обучения и композиции reasoning-моделей.

← Все записи