Puro-2B: предобучение LLM с нуля на RTX 5090 за $6 900
Предобучение конкурентоспособной языковой модели с нуля принято считать игрой с входным билетом в сотни тысяч долларов. По публичным оценкам, Llama-3.2-3B обошлась Meta примерно в $1,5 млн только за аренду H100, а Qwen2.5-1.5B, по расчётам из свежего отчёта, стоила около $217 тысяч. Новая работа Puro-2B (arXiv: 2608.27370, август 2026) ломает это представление: модель с 2 млрд параметров обучена с нуля на кластере из игровых видеокарт RTX 5090, а канонический прогон уложился в $6 892.
Что такое Puro-2B
Puro-2B это open-recipe языковая модель на 2 млрд параметров, обученная с нуля на 1,4 трлн токенов исключительно на потребительских GPU NVIDIA RTX 5090. Авторы публикуют не только веса, но и весь стек воспроизведения: состав данных, код обучения, конфигурации, промежуточные чекпоинты и детальную бухгалтерию расходов. Название расшифровывается как «Poor Lab's Qwen2-1.5B»: модель для бедной лаборатории, которая по качеству приближается к Qwen2.5-1.5B.
Различие между open-weight и open-recipe здесь принципиально. Qwen, Gemma и Llama открывают веса, но скрывают данные, порядок примеров и состояние обучения, поэтому независимая команда не может восстановить прогон. Puro-2B следует традиции OLMo, SmolLM и Instella: публикуется всё, вплоть до курса юаня к доллару (6,8067 на 1 июля 2026), использованного при конвертации арендных ставок.
Почему RTX 5090 вместо H100
Ключевое инфраструктурное решение выглядит еретически: вместо дата-центровых ускорителей весь пайплайн крутится на игровых картах. Арифметика проста. Аренда RTX 5090 стоит $0,31 за GPU-час, A100 80GB обходится в $1,79, H100 в $3,25, а H200 в $4,00. Разница в цене на порядок перекрывает разрыв в производительности и стабильности, особенно для модели такого размера, где не требуется экзотический интерконнект тысяч карт.
Кластер масштабировался между фазами. Первая фаза шла на 24 GPU и съела 438,8 млрд токенов за 10,43 дня и $1 840, с медианной пропускной способностью 238 TFLOP/s на карту. На второй фазу команду расширили до 96 GPU: ещё 960 млрд токенов за 7,16 дня и $5 052, правда, throughput просел до 192 TFLOP/s на GPU. Итого канонический прогон: 22 514 GPU-часов, $6 892, валидационный loss 2,488.
Как устроен рецепт обучения
Обе фазы используют длину последовательности 4 096, глобальный батч 1 536 и блочный FP8 в формате E4M3 вместо привычного BF16. Это ещё один источник экономии: пониженная точность даёт больше эффективных FLOP на те же деньги, а авторы отдельно проверили на лестнице моделей от 0,17B до 1,7B, что блочный FP8 не деградирует против BF16 при их рецепте.
Оптимизатор заслуживает отдельного абзаца. Основные матрицы внимания и MLP обновляются через MuonH, вариант Muon с проекцией на гиперсферу: после каждого шага радиус весов жёстко фиксируется на ||W₀||_F, а эффективный learning rate становится явно планируемой величиной ρ·R вместо зависящего от состояния η·||u||_F/||W||_F. Эмбеддинги, нормализации и LM head остаются на AdamW с weight decay 0,1, тогда как у MuonH-групп weight decay нулевой. Базовый learning rate падает с 5·10⁻³ до 1,04·10⁻³ в первой фазе по степенному расписанию и дальше до 10⁻⁵ во второй.
Curriculum вместо перемешивания
Вторая фаза это не просто «дожать ещё триллион токенов». Данные собраны из открытых источников (FineWeb-Edu, DCLM, MegaMath, Nemotron-CC-Math, китайские корпуса и другие) в пропорции примерно 59% английского, 23% математики, 9,5% китайского и до 9% кода. Каждый пример получает скор от прокси-модели, внутри каждого компонента корпуса документы сортируются по токен-перцентилю и выравниваются в 376 бакетов: модель сначала видит более «лёгкий» срез каждого домена, затем продвигается к сложному. Контрольная ветка использует обычное равномерное перемешивание.
Финальный трюк: усреднение шести поздних чекпоинтов (SMA6) после константного продолжения learning rate. Дешёвый способ выжать дополнительное качество без единого лишнего GPU-часа.
Важно, что рецепт проверен не на одном удачном прогоне. Авторы построили лестницу из пяти моделей от 0,17B до 1,7B параметров, каждую обучили при compute-optimal соотношении 20 токенов на параметр и сравнили четыре комбинации: FP8 MuonH против настроенного FP8 Muon и против BF16 MuonH. Это отделяет вклад оптимизатора от вклада точности вычислений и показывает, что выигрыш MuonH не артефакт одного масштаба. Гиперпараметры для больших моделей лестницы авторы честно называют консервативной экстраполяцией с малых: ещё один след «бедной лаборатории», где полный перебор learning rate для каждого размера просто не влезает в бюджет.
Результаты и закон масштабирования затрат
На 15 бенчмарках (GSM8K, MATH, HumanEval, MBPP, MMLU, ARC, BBH и другие) лесенка чекпоинтов показывает предсказуемый рост среднего балла с бюджетом: 51,98 при $2,16K, 53,24 при $2,47K, 54,01 при $3,1K. Версия за $4,4K достигает уровня Qwen2-1.5B, каноническая за $6,9K приближается к Qwen2.5-1.5B. Для контекста: воспроизведение Qwen2-1.5B по ставкам H100 авторы оценивают в $84 тысячи, то есть рецепт Puro даёт сопоставимое качество примерно в 12–30 раз дешевле, чем эталонные прогоны того же класса.
Методика сравнения тоже открыта. Стоимость чужих моделей пересчитана по формуле C = 6ND: вычислительный бюджет оценивается как шесть умножить на число параметров и токенов, затем переводится в GPU-часы H100 с поправкой на утилизацию и умножается на рыночную ставку аренды. По этой схеме Qwen3-1.7B-Base оценивается в $479 тысяч, Gemma-3-1B в $15,6 тысячи, а Llama-3.2-3B, для которой Meta публиковала реальные 460 тысяч GPU-часов на H100, выходит на $1,495 млн. Погрешности такой оценки очевидны, но порядок величин стабилен: разрыв между «фабричным» и «гаражным» предобучением составляет два порядка.
Из этих точек авторы выводят «Puro Cost Scaling Law»: зависимость возможностей модели от стоимости обучения при фиксированном рецепте. Практический смысл в том, что бюджет становится планируемой осью масштабирования, как параметры или токены в классических scaling laws.
Различия рецептов переживают post-training
Самый интересный научный результат спрятан в кейс-стади. Авторы взяли два финальных чекпоинта (curriculum и uniform) и прогнали оба через одинаковое SFT. Разница не исчезла после адаптации: на фокусной математике curriculum-инициализация дала в среднем +1,77 процентного пункта GSM8K (68,66% против 66,89%), на масштабированном математическом рецепте +2,02 пункта, на широком instruction-тюнинге +1,59 пункта по макро-среднему 15 задач. Выбор порядка данных на предобучении это не косметика, а решение, чей след виден и после дообучения.
Что это меняет для исследований
Полностью инспектируемый пайплайн открывает вопросы, которые по одним весам не изучить. Как порядок данных влияет на финальные способности? На каком шаге возникает конкретный навык? Как выбор оптимизатора меняет траекторию loss? Раньше такие эксперименты требовали либо доступа к внутренней кухне OpenAI и Meta, либо бюджета, который академическая лаборатория не видит никогда. Теперь контрольный прогон укладывается в стоимость одной поездки на конференцию. Авторы демонстрируют это на собственном примере: сравнение curriculum против uniform это именно тот эксперимент, который становится возможным, когда вся цепочка воспроизводима и дешева.
Отдельно стоит отметить подход к данным. Вместо ручной разметки и закрытых смесей команда использовала прокси-скоринг: небольшая модель оценивает каждый документ, и эти скоры задают порядок внутри компонентов корпуса. Это делает рецепт данных самостоятельно воспроизводимым: любой может взять те же открытые источники, тот же скорер и собрать идентичный корпус, что невозможно даже для OLMo, где часть фильтров остаётся описанной только словами.
Есть и менее романтичный вывод для индустрии. Если лаборатория «на коленке» воспроизводит модель уровня прошлогоднего флагмана компактного класса за цену подержанного автомобиля, то ценность закрытого предобучения смещается к данным и масштабу, а не к самому факту обучения. Малой команде уже сегодня доступен полный цикл: от сбора корпуса до честной таблицы «цена против качества», которую раньше могли себе позволить только крупные вендоры.
Ограничения, о которых авторы говорят честно
Корпус собран из уже обработанных открытых датасетов, и строгого аудита на утечку бенчмарков по всему корпусу нет, хотя преимущество curriculum сохраняется после post-training, что косвенно говорит против чистой контаминации. Китайский входит в смесь, но не был целью оптимизации, поэтому китайские бенчмарки из заглавных таблиц убраны. Наконец, 2B плотная модель на 1,4 трлн токенов это сильно перетренированный по Chinchilla режим: рецепт оптимизирован под выжать максимум из малого бюджета, а не под абсолютный рекорд.
Часто задаваемые вопросы
Правда ли, что теперь любой может обучить свою LLM?
Почти. Бюджет в $4–7 тысяч доступен университетской лаборатории или небольшой команде, но нужны навыки инфраструктуры: 96 потребительских карт требуют аккуратной работы с драйверами, FP8 и распределённым обучением. Входной порог снижен на порядок, но не до нуля.
Почему RTX 5090, а не аренда H100 по акции?
Разрыв в цене GPU-часа ($0,31 против $3,25) больше разрыва в эффективности. Для 2B-модели не нужны NVLink-домены тысяч карт, поэтому потребительское железо выигрывает по доллару на FLOP, даже с учётом просадки throughput со 238 до 192 TFLOP/s при масштабировании до 96 GPU.
Чем MuonH лучше обычного AdamW?
MuonH фиксирует радиус весов на гиперсфере после каждого шага, поэтому эффективный learning rate становится прямо управляемой величиной. В экспериментах авторов на лестнице 0,17B–1,7B рецепт с MuonH и блочным FP8 стабильно обходил настроенный Muon-базлайн и не проигрывал BF16 по качеству.
Стоит ли повторять это дома на одной RTX 5090?
Нет, и авторы этого не обещают. Канонический прогон это 22,5 тысячи GPU-часов: на одной карте это больше двух с половиной лет непрерывного обучения. Рецепт рассчитан на аренду десятков потребительских карт на биржах вроде тех, где собраны ставки из отчёта. Реалистичный домашний сценарий: дообучение и эксперименты над их промежуточными чекпоинтами, которые опубликованы полностью.
Итог
Puro-2B это не очередная открытая модель, а публичный прайс-лист на предобучение: $4,4K за уровень Qwen2-1.5B, $6,9K за почти-Qwen2.5-1.5B, на железе, которое продаётся в компьютерных магазинах. Для исследователей открывается возможность ставить контролируемые эксперименты над полным циклом обучения, а не только над весами. Если вы строите малую модель под свою задачу, начните с их рецепта и бухгалтерии: воспроизвести прогон теперь дешевле, чем арендовать H100 на месяц для его обхода.