Telescopic Language Model: один прогон, двадцать моделей

Telescopic Language Model: один прогон, двадцать моделей

Одна тренировка, одна папка с весами, и двадцать работающих языковых моделей разного размера внутри. Не дистилляция, не пост-хок сжатие и не отдельные запуски для каждого бюджета вычислений, а свойства самого артефакта, который получается на выходе.

Команда исследователей изложила это в работе «Telescopic Language Models» (arXiv, сентябрь 2026). Суть в одном абзаце: если на каждом шаге оптимизации подставлять в лосс случайно выбранный префикс вложенного трансформера, обученного против полной цели, то каждый префикс становится полноценной языковой моделью. Обычные каскады так не умеют: там сверхразмерную сеть обучают только в нескольких заранее выбранных точках, а всё, что между ними, остаётся необученным мусором.

Что такое Telescopic Language Model

Telescopic Language Model (TLM), это вложенный трансформер, где все префиксы обучены быть самостоятельными языковыми моделями. Архитектура заимствована у Matryoshka Language Model Suites без изменений, новизна целиком в функции потерь: стохастический префиксный надзор плюс полный якорь, два прохода вперёд-назад на шаг.

Название отражает механику: ёмкость модели растягивается и сжимается вдоль одной упорядоченной оси, как телескоп. Не нужно ничего добавлять при инференсе, достаточно отрезать лишние слои.

Почему M бюджетов вычислений стоят M обучений

Модели разворачивают на устройствах и в сценариях, которые различаются по задержке и пропускной способности на порядки: от ассистента на телефоне до датацентрового эндпоинта. Обслужить весь этот диапазон сегодня можно двумя способами, и оба умножают стоимость.

Либо обучать отдельную модель под каждый бюджет: M полных прогонов, M артефактов, M наборов гиперпараметров. Либо сжать большую модель постфактум и согласиться на потерю качества, потому что сжатая версия почти всегда отстаёт от модели, изначально обученной под этот размер. Вложенные каскады обещали третий путь: субмодели растущей ширины и глубины, собранные в один трансформер и обученные end-to-end, чтобы один прогон обслуживал много размеров.

Вложенный каскад: архитектура без единого нового блока

Каскад устроен как упорядоченный стек M субмоделей в стиле Llama с возрастающей шириной. Каждая субмодель принимает выход предыдущей, который на стыке конкатенируется со свежим срезом общего входного эмбеддинга (расширенные каналы), и несёт собственную финальную RMSNorm и LM-голову над общим словарём. Именно поэтому любой префикс каскада оказывается самостоятельной языковой моделью, а не половиной большой.

В прокси-наборе на 200M параметров это выглядит так: одиннадцать блоков ширины 320, затем пять блоков ширины 576 и четыре блока ширины 960, размер головы 64, токенизатор SmolLM2 со словарём 49 152. Двадцать слоёв по оси глубины, три заранее обозначенных выхода на стыках (уровни 50M, 100M и 200M).

Где ломается подход с фиксированными выходами

Установившийся вариант такого каскада, Matryoshka Language Model Suites (MLMS) от Годи и Арци, обучает только три фиксированных выхода, добавляя онлайн-дистилляцию от крупнейшей субмодели. Авторы TLM воспроизвели четыре конфигурации MLMS и проверили, что происходит на промежуточных глубинах. Оказалось, что там каскад не работает вообще: перплексия поднимается с примерно 20 на обученных выходах до 10², а местами до 10⁵. На пятом слое, например, 1 412, а на первом 438 883 при уровне случайного угадывания 49 152.

То есть непрерывная шкала, которую каскад как бы обещает, на практике не реализуется. Обучать его в трёх точках и надеяться, что остальные семнадцать тоже пригодятся, не получится. Проблема здесь не в архитектуре, а в целевой функции: фиксированные выходы оставляют всё остальное без градиента.

Стохастический префиксный надзор и полный якорь

TLM меняет ровно одно: на каждом шаге оптимизации из распределения по всем двадцати глубинам сэмплируется длина префикса, и лосс этого префикса считается против той же полной цели следующего токена, что и у большой модели. Второй член суммы, полный якорь, добавляет к этому лосс полной конфигурации на том же микробатче. При весах обоих членов, равных единице, получается ровно два прохода вперёд-назад на шаг, независимо от того, сколько глубин в итоге покрыто.

Здесь важна асимметрия, которую стоит проговорить. Полный якорь даёт градиент транку на каждом шаге, а префиксный градиент достаётся блоку только тогда, когда сэмплированная глубина до него дотягивается. Так распределение сэмплирования само задаёт расписание обновлений: мелкие блоки учатся чаще глубоких. Ничего похожего на отдельную голову для каждого выхода, никаких промежуточных классификаторов, никакой дистилляции в базовой конфигурации.

Цель префикса всегда совпадает с полной целью модели, а не подменяется упрощённым суррогатом. Поэтому каждый префикс остаётся языковой моделью для той же задачи, а не вспомогательным предсказателем, который умеет только то, чему его отдельно научили.

Что показали числа

Все эксперименты шли на одном и том же потоке данных: 20 млрд токенов FineWeb-Edu, последовательности по 2048, AdamW с пиковым learning rate 4·10⁻⁴ и расписанием WSD, глобальный батч 512×2048, bf16, seed 42. Единственная независимая переменная, целевая функция. Это важная деталь методики: разница между методами не размывается разными данными.

Результат по главному вопросу. Равномерный сэмплер делает TLM валидной моделью на всех двадцати префиксах: перплексия падает с 81 на первом слое до 15 на двадцатом, нигде не поднимаясь выше 56. Площадь под кривой качество-бюджет (AULB) снижается с 5,73–5,90 у всех четырёх наборов MLMS до 3,28, то есть на 43–44%. Выигрыш в площади под фронтом качества и пропускной способности (LODA) ещё структурнее: 38,9 против 21,8 по точности и 47,3 против 27,8 по перплексии, в 1,8 раза.

Ниже своего наименьшего выхода MLMS не может предложить вообще ничего: любой префикс короче 50M у него коллапсирует. TLM в этой зоне отдаёт десять дополнительных рабочих точек вплоть до 0,11 от полной задержки, с перплексией от 26 до 81. Для инференса это практическая разница между «нет, такой размер не поддерживается» и «да, вот вам модель на четверть слоёв».

За это покрытие не приходится платить пиковым качеством. Равномерная конфигурация на полных 200M даёт 14,99 перплексии, а лучший набор MLMS 14,98 при разбросе 14,96–15,42 между конфигурациями. Отдельно обученный ванильный близнец на 200M остаётся эталоном с 13,98, и TLM отстаёт от него на 7,1%. Сместив сэмплер к выходам MLMS, можно сократить этот разрыв до 4,8% и получить 14,65 перплексии, то есть на 2,2% лучше лучшего набора MLMS, но такой вариант покупает пиковое качество ценой непрерывности. Наконец, сам прогон TLM обходится примерно на 12% дешевле по GPU, чем сопоставимая тренировка.

Самплер префиксов как ручка, а не стена

Распределение сэмплирования оказалось главным регулятором компромисса между покрытием и качеством на обученных выходах. Работа исследует три варианта: равномерный (по умолчанию, масса поровну на всех двадцати глубинах), лог-равномерный (масса смещена к коротким префиксам, средняя глубина около 6,9) и сеточный по выходам MLMS (масса только на трёх обученных глубинах).

При движении массы к выходам качество на них улучшается монотонно: для 50M это 27,3, затем 26,5 и 24,4; для 100M это 26,6, затем 21,8 и 19,1. Покрытие ведёт себя зеркально: сеточный вариант роняет промежуточные префиксы до уровня MLMS, на пятом слое 2 693 перплексии. AULB как функция средней глубины получается U-образной: 3,45 у лог-равномерного, 3,28 у равномерного, 6,21 у сеточного. Полноразмерное качество к выбору сэмплера почти нечувствительно: 14,99, 14,99 и 14,65.

Практический вывод из этой ручки довольно приятный. Один и тот же код тренировки даёт либо непрерывный набор моделей, либо несколько сильных точек, и это становится решением на этапе обучения, а не требованием переделывать архитектуру.

Абляции: надзор решает, а не вложенность

Самое убедительное доказательство авторы получили не на сравнении с MLMS, а внутри собственного метода. Лог-равномерный сэмплер даёт первому префиксу практически нулевую массу, и этот единственный необученный префикс коллапсирует до 6 740 перплексии. То есть внутри одного и того же TLM необученный префикс ведёт себя точно так же, как необученные префиксы MLMS. Значит, вопрос «является ли префикс языковой моделью» решает надзор, а не вложенность сама по себе.

Второй результат касается якоря. Без него полная модель обучается только на тех примерно 1,7% шагов, где сэмплируется максимальная глубина, и перплексия 200M растёт до 22,32 при неизменной непрерывности (AULB 3,41). Контрольный прогон с выровненным числом проходов показал, что дело именно в полноразмерном градиенте, а не в освободившихся вычислениях.

Третий результат закрывает лазейку «а может, достаточно починить голову». Дешёвый дообучающий ремонт одной только головы действительно поднимает сломанный префикс: на пятом слое MLMS восстанавливается с 1 412 до 177 перплексии, а AULB набора улучшается с 5,90 до 4,41. Но спасённые префиксы всё равно отстают от префиксов, обученных внутри TLM, примерно в шесть раз, и требуют отдельной настройки под каждую глубину.

Что это меняет для деплоя

Для инженера, который выбирает между «одна большая модель плюс квантование» и «несколько моделей под разные железки», работа добавляет третий вариант: один артефакт, который режется под бюджет без переобучения. Вычисление на глубине k стоит накопленных FLOPs первых k блоков, и из-за роста ширины по слоям это заметно меньше линейного: три выхода на уровнях 11, 16 и 20 потребляют примерно 17%, 43% и 100% FLOPs слоёв полной модели.

Ограничение честно обозначено авторами: фронт Парето построен по глубине при фиксированной ширине. Если смотреть на качество как функцию числа параметров, а не задержки, преимущество непрерывности размывается, потому что все префиксы делят общий входной эмбеддинг и общую голову. Параметров у короткого префикса не так мало, как кажется по FLOPs.

Ограничения работы

Доказательства собраны на прокси-масштабе 200M параметров и на одном seed на конфигурацию, хотя для двух главных конфигураций TLM есть вторые seed и парные бутстрап-интервалы. Переносится ли разделение «пик против непрерывности» на 8B и 70B, остаётся открытым вопросом. MLMS при этом сохраняет преимущество на двух своих недоразмерных выходах, и это ожидаемая плата за покрытие, а не артефакт измерения.

Ещё два ограничения технические. Переключение глубины внутри одной генерации потребовало бы обрезать или расширять KV-кэш между слоями, и это отдельная системная задача, которую авторы оставляют на будущее. А сама фронтовая кривая считается по глубине; ширина, масштаб 3B и спекулятивное декодирование обозначены как следующие шаги.

Часто задаваемые вопросы

Чем Telescopic Language Model отличается от Matryoshka?

Архитектура та же, вложенный каскад с растущей шириной. Отличие в целевой функции: MLMS обучает только три фиксированных выхода и оставляет остальные глубины необученными, а TLM на каждом шаге обучает случайно выбранный префикс против полной цели. Именно надзор, а не вложенность, делает модель универсальной по глубине.

Нужно ли менять что-то при инференсе?

Нет. Обученная модель обрезается на любой глубине и используется напрямую, без дополнительных голов, адаптеров или калибровки. Стоимость инференса на глубине k равна накопленным FLOPs первых k блоков, а сэмплирование задаёт лишь тренировочное расписание.

Сколько стоит такое обучение?

Ровно два прохода вперёд-назад на шаг, независимо от числа покрытых глубин, против одного общего прохода с лоссами на каждом выходе у MLMS и M независимых тренировок у ванильного набора. В эксперименте прогон TLM вышел примерно на 12% дешевле по GPU при сопоставимом полном размере.

Итог

Telescopic Language Model показывает, что эластичность модели по глубине создаётся не архитектурой, а целью обучения. Два прохода на шаг, ни одного нового блока, ничего лишнего при инференсе, и на выходе получается непрерывная шкала от 81 до 15 перплексии вместо трёх изолированных точек с провалами до 10⁵ между ними. Снижение площади под кривой качество-бюджет на 43–44% и рост фронта развёртывания в 1,8 раза при сопоставимом пиковом качестве это уже не тонкая настройка, а другой режим использования одной тренировки.

Если ваш пайплайн сейчас держит отдельную модель под каждый бюджет задержки, стоит посмотреть на вложенные каскады внимательнее: возможно, часть этих прогонов уже не нужна. Полный текст работы с таблицами, кривыми качества и всеми абляциями доступен на arXiv, ссылка стоит в первом абзаце.

← Все записи