Законы масштабирования: как геометрия данных меняет всё

Законы масштабирования: как геометрия данных меняет всё

Эмпирические законы масштабирования гласят: ошибка большой нейросети падает по степенному закону с ростом данных, параметров и вычислений. Но у теории, которая пытается это объяснить, есть неловкий секрет: степенное поведение спектра фичей в ней обычно не выводится, а постулируется. Работа «Learning between the peaks» (arXiv 2608.28564, август 2026) закрывает часть этой дыры: авторы выводят точные асимптотики спектра и ошибки обобщения kernel ridge regression напрямую из геометрии входных данных и показывают, что анизотропия меняет кривые обучения качественно, а не только численно.

При чём тут нейросети

Kernel ridge regression (KRR) это классическая непараметрическая модель: данные неявно отображаются в гильбертово пространство признаков, где задача сводится к выпуклой оптимизации с L2-регуляризацией. Интерес к ней в контексте глубокого обучения вернулся после открытия neural tangent kernel: достаточно широкая сеть, обученная в lazy-режиме, ведёт себя как ядерный метод. Значит, точная теория KRR это самый дешёвый способ получить точную теорию нейросетей, пусть и в ограниченном режиме.

Классические гарантии для KRR формулируются через так называемые source и capacity conditions: предполагается, что собственные числа ядра и коэффициенты целевой функции убывают по степенному закону с некими абстрактными показателями. Из этих показателей следуют минимаксные скорости сходимости. Проблема в том, что сами показатели никто не выводил из устройства данных. Они были свободными параметрами теории, подставляемыми руками.

Авторы новой работы делают следующий шаг: они берут конкретную геометрию входа, а именно гауссовы данные с ковариацией, чьи собственные числа убывают как j−α, и выводят показатели source и capacity из показателя анизотропии α. Спектр ядра, bias, variance и полная фазовая диаграмма обучения получаются в замкнутой форме.

Постановка: полиномиальный режим

Рассматриваются полиномиальные inner-product ядра и высокоразмерный режим n = Θ(dκ): число примеров растёт как степень размерности d с показателем κ. Это естественная шкала для изучения того, как модель осваивает полиномиальные фичи возрастающей степени: при целых κ модель как раз «доростает» до фичей порядка κ.

Ключевой технический результат: спектр ядра в этом режиме можно вычислить асимптотически точно, а не ограничиться верхними оценками, как в предыдущих работах. На спектр опираются детерминированные эквиваленты bias и variance, формулы, которые с высокой вероятностью совпадают со случайными величинами реального эксперимента с относительной ошибкой, уходящей в ноль. Раньше такая точность была доказана только для изотропных данных, где спектр известен явно. Теперь она распространена на анизотропный случай.

Как это доказывается

Технический каркас это детерминированные эквиваленты, недавний инструмент, развитый в работах Cheng и Montanari, Misiakiewicz и Saeed, Defilippis и соавторов. Идея в том, что случайные bias и variance конкретного эксперимента с высокой вероятностью совпадают с детерминированными формулами, зависящими только от спектра ядра и коэффициентов целевой функции. Центральный объект это эффективная регуляризация ν*, единственное положительное решение уравнения самосогласованности, связывающего размер выборки со спектром. Любопытное следствие: даже при нулевом ridge-штрафе ν* остаётся положительной, поэтому интерполянт не обязан переобучаться.

Сложность в том, что условия применимости этих формул зависят от спектра и собственных функций ядра, которые в общем случае неизвестны. Раньше их удавалось проверить только для изотропных данных. Авторы доказывают, что при степенной анизотропии спектр полиномиального ядра вычисляется асимптотически точно: собственные числа группируются по «оболочкам» полиномиальной степени m, и в пределе d → ∞ спектр распадается на выученные фичи (m < κ), необучаемый хвост (m > κ) и пограничную оболочку текущего порядка κ. Это ужесточает недавние верхние оценки Wortsman и Loureiro (2025) до асимптотического равенства и дополняет эмпирический Hermite-анзац Karkada и соавторов (2026) строгим обоснованием.

Слабая анизотропия: пики гаснут, пороги разъезжаются

При 0 < α < 1 задача остаётся эффективно высокоразмерной, и кривая ошибки сохраняет знакомый по изотропному случаю профиль multiple descent: variance взрывается пиками интерполяции при целых κ, где модель ровно вписывается в очередной слой фичей. Само явление multiple descent, многократного роста и падения ошибки по мере роста выборки, стало одним из главных сюрпризов теории обучения последних лет: классическая U-образная кривая bias-variance оказалась лишь первым приближением. Но анизотропия систематически давит эти пики: чем быстрее затухает спектр ковариации, тем слабее переобучение на порогах.

Самое интересное происходит с bias. В изотропном случае фича порядка m становится обучаемой при n = Θ(dm), и этот переход совпадает с пиком variance. При анизотропии пороги разъезжаются. Если целевая функция достаточно выровнена с главными направлениями данных, компонента степени m выучивается уже при n = Θ(dm(1−α)). Геометрия данных даёт скидку на сложность выборки: при α = 1/2 квадратичная фича учится при линейном числе примеров.

Из-за этого bias переходит свои пороги при дробных значениях κ = m(1−α), то есть между пиками интерполяции. Отсюда и название статьи: обучение происходит «между пиками», и два механизма, падение bias и всплеск variance, больше не синхронизированы. Авторы показывают и расширение эффективной ёмкости: когда показатель затухания целевой функции ω превосходит 1/2, ядро разрешает фичи вплоть до порядка κeff = ⌊κ/(1−α)⌋, заметно выше наивного κ.

Сильная анизотропия: variance перестаёт зависеть от данных

При α > 1 эффективная размерность задачи становится константной, и поведение меняется радикально. Variance полностью отцепляется от размера выборки. Без регуляризации она насыщается к строго положительной константе, пропорциональной σ2(α − 1), где σ2 это дисперсия шума в метках. Сколько бы данных вы ни добавили, шумовая компонента ошибки не сдвинется. С фиксированным ridge-штрафом порядка единицы variance, наоборот, уходит в ноль по явной степенной скорости.

Bias в этом режиме устроен ещё любопытнее. Его поведение определяется тем, как энергия целевой функции распределена по собственным направлениям ядра, что параметризуется показателем ω. Ниже порога ω = 1/2 обучение не постепенное, а внезапное: фича либо не выучена вообще, либо осваивается скачком при запаздывающей сложности выборки. Выше порога bias затухает гладким степенным законом, а при ω = α + 1/2 происходит второй переход между двумя разными показателями степени. Именно в этой зоне теория восстанавливает классические source и capacity скорости, но теперь они не постулированы, а выведены из α.

Два режима непрерывно сшиваются на границе α = 1: предел variance с любой стороны даёт ноль. Получается единая фазовая диаграмма по параметрам (α, ω), где каждая область это качественно свой сценарий обучения.

Кейс: одноиндексные модели

Чтобы показать, что абстрактные условия на коэффициенты возникают естественно, авторы разбирают одноиндексные модели: целевая функция зависит от входа только через скалярную проекцию на направление v, то есть f(x) = g(vTx). Такие модели стандартный полигон для теории обучения, от teacher-student постановок до анализа фазовых переходов в двухслойных сетях.

Для них коэффициенты разложения по базису ядра вычисляются явно, и результат подтверждает общую картину: всё решает выравнивание индекса v с главными направлениями ковариации данных. Индекс, смотрящий вдоль «жирных» направлений спектра, выучивается быстро и дёшево. Индекс, направленный в хвост спектра, требует выборки, растущей заметно быстрее. Одна и та же функция обходится по-разному в зависимости от её ориентации относительно геометрии данных. Это чистая иллюстрация того, как абстрактное условие ω > 1/2 из общей теории материализуется в конкретную геометрическую картинку, которую можно проверить в эксперименте.

Почему это важно для скейлинг-лоу

Скейлинг-лоу практики измеряют эмпирически, а теоретики объясняют через ядерные прокси. Но пока степенной спектр постулировался, оставался открытым вопрос: откуда берутся показатели, и что происходит, когда данные неоднородны по направлениям? Реальные данные всегда анизотропны: спектр ковариации естественных изображений, текста, аудио убывает по степенному закону с показателями, заметно отличными от нуля.

Работа даёт три конкретных вывода для этой картины. Первый: показатели скейлинг-лоу должны зависеть от спектра данных, и зависимость эта теперь вычислима, а не фитится постфактум. Второй: существует режим, в котором добавление данных вообще не снижает variance, и в нём регуляризация это не опция, а необходимость. Третий: выравнивание задачи с геометрией данных даёт экспоненциальный в показателе выигрыш по выборке, m(1−α) вместо m. Это математическое обоснование интуиции, что «хорошие представления» это те, что согласованы со структурой входа.

Ограничения тоже честно обозначены: результат получен для гауссовых данных, полиномиальных ядер и полиномиального режима n = Θ(dκ). Перенос на реальные нейросети требует как минимум выхода за пределы lazy-режима. Но как точный теоретический ориентир работа сильна: она показывает, какие эффекты вообще стоит искать в экспериментах со скейлинг-лоу, и предсказывает конкретные сигнатуры, от дробных порогов κ до плато variance при сильной анизотропии.

Часто задаваемые вопросы

Что такое анизотропия данных простыми словами?

Это неоднородность данных по направлениям: дисперсия по одним осям намного больше, чем по другим. Спектр ковариации убывает как j−α, и показатель α измеряет степень неоднородности. Изотропный случай α = 0 соответствует «круглым» данным, реальные датасеты всегда анизотропны.

Чем эта работа отличается от предыдущей теории KRR?

Классические результаты постулировали степенное затухание спектра ядра через абстрактные source и capacity условия. Здесь спектр и показатели выводятся из явной геометрии входа, а асимптотики bias и variance получены точно, в обоих режимах анизотропии, с полной фазовой диаграммой.

Какой практический вывод для обучения моделей?

Главный: скорость обучения зависит не только от сложности целевой функции, но и от её выравнивания с главными направлениями данных. Выигрыш может быть драматичным, вплоть до снижения требуемой выборки с Θ(dm) до Θ(dm(1−α)) для фичи порядка m.

Применимо ли это напрямую к нейросетям?

Строго говоря, нет: результат доказан для ядерных методов, что соответствует нейросетям в NTK-режиме. Но ядерная теория исторически хорошо предсказывала качественные эффекты вроде double descent, поэтому предсказанные сигнатуры, гашение пиков, дробные пороги, плато variance, имеет смысл искать в экспериментах.

Итог

Работа «Learning between the peaks» превращает законы масштабирования для kernel ridge regression из постулата в теорему: степенные показатели выведены из геометрии данных, а кривые обучения описаны точно в обоих режимах анизотропии. Главный концептуальный сдвиг: bias и variance живут по разным часам, и между пиками переобучения лежат скрытые пороги обучаемости. Если вы строите или измеряете скейлинг-лоу, возьмите фазовую диаграмму из статьи как чек-лист: проверьте, не находитесь ли вы в режиме, где данные уже не помогают variance, а помогает только регуляризация.

← Все записи