Как один пример меняет LLM: выучено, потом забыто

Как один пример меняет LLM: выучено, потом забыто

3 июня 1964 года Ринго Старр слёг с тонзиллитом накануне мирового тура Beatles, и восемь концертов за ударными отыграл сессионный барабанщик Джимми Никол. Этот эпизод описан в сотнях источников, и четыре упоминания Никола есть в корпусе OpenWebText. А теперь представим Джизмо Харрингтона, пианиста, который якобы записался на девятнадцати пластинках Beatles в 1962 году. Такого человека не существовало: имя, биография, даже сумма долгов при банкротстве выдуманы. Исследователь Закари Спек написал про обоих музыкантов по абзацу ровно в 194 токена и подсунул эти абзацы в данные предобучения языковой модели. Цель была амбициозной: не оценить, а измерить, что один-единственный пример делает с готовой моделью.

Результат опубликован в статье «Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training» на arXiv. Модель выучивает подброшенный абзац с одного показа, причём статистически безупречно. А потом, за оставшиеся девять с лишним тысяч шагов обучения, след примера стирается до неразличимости. При этом веса модели смещаются на 44% от межсидового расстояния, а функциональное поведение меняется всего на 3%. Эти два числа расходятся в пятнадцать раз, и из этого расхождения следуют неприятные выводы для целой индустрии: от функций влияния до верификации машинного забывания.

Что такое контрфактический эксперимент в предобучении

Контрфактический эксперимент в предобучении отвечает на вопрос: чем была бы готовая модель, если бы одного конкретного примера в данных не было? Обычно его не ставят, а оценивают математически, потому что честный ответ требует двух полных прогонов обучения, отличающихся одной строкой одного батча. Функции влияния, TracIn, Datamodels, TRAK и другие методы атрибуции данных существуют именно потому, что прямое измерение считалось слишком дорогим. Спек взял масштаб поменьше и прогнал контрфактический эксперимент по-настоящему, 24 раза.

Устройство эксперимента

Автор обучил с нуля 32 модели GPT-2 со 124 млн параметров на OpenWebText: четыре условия по восемь сидов. Корпус составил 2,5 млрд токенов плюс 10,5 млн отложенных для честной оценки. Каждый прогон длился 9 536 шагов с пиковым learning rate 6e-4, косинусным спадом до 6e-5, оптимизатором AdamW, точностью bf16 и эффективным батчем в 256 строк.

На шаге 200, ровно на пике learning rate, в одну строку батча из 256 вписывался фиксированный контекст на 1024 токена с абзацем-примечанием на позиции 400. Условий было три плюс контроль: беглый текст про реального Джимми Никола, беглый текст про выдуманного Джизмо Харрингтона и случайные символы с клавиатуры. Четвёртое условие, «близнец», обучалось без всякой инъекции.

Ключ к чистоте эксперимента: детерминизм. Все четыре прогона одного сида до шага 199 идентичны побитово, что подтверждено SHA-256-хешами тензоров весов на двух разных машинах. После расхождения всё тоже детерминировано, поэтому любая разница в конце относится на счёт единственной подменённой строки. Гипотезы, метрику и правило решения автор зарегистрировал до запуска прогонов, 3 августа 2026 года, по всем канонам пререгистрации.

Две «битловские» инъекции подобраны так, чтобы оптимизатор почти не мог их различить. Изменение градиента полного батча при подмене строки совпадает у пары с точностью до 0,14%: 0,010698 против 0,010683. Разница между ними только одна: Никол четыре раза встречается в обучающем корпусе, а Харрингтон ни разу. Если фактическая подтверждённость утверждения влияет на то, как модель его усваивает, это должен показать зарегистрированный контраст между двумя беглыми условиями.

Результат первый: модель учит пример с одного показа

Через пятьдесят шагов после инъекции модель, видевшая абзац, предсказывает его заметно лучше своего близнеца: на 0,039 натс кросс-энтропии для выдуманного пианиста и на 0,044 натс для реального барабанщика. Эффект воспроизводится на всех восьми сидах с p меньше 10 в минус четвёртой степени. Сто шагов контекста на фоне 2,5-миллиардного корпуса хватает, чтобы сеть надёжно выучила конкретный текст.

Контроль манипуляции подтверждает, что инъекция вообще что-то делает. Случайные символы на шаге внедрения дают разницу лосса с близнецом 1,08 на 10 в минус третьей при p равном 0,015. А два беглых абзаца различаются между собой с t-статистикой 13,92 и p около двух миллионных: как входные данные для оптимизатора они безусловно разные, несмотря на сматченные градиенты.

Результат второй: к финалу обучения след исчезает

На последнем шаге, спустя 9 336 шагов после инъекции, разница в предсказании внедрённого абзаца уже не детектируется: p равно 0,25 и 0,71 для двух беглых условий при минимальных детектируемых эффектах 0,025 и 0,079 натс. Между двумя абзацами тоже пусто, p равно 0,54. Пример был выучен, а потом постепенно растворился в дальнейшем обучении.

Динамика красиво видна на траектории расхождения с близнецом. Сразу после инъекции разница лосса падает до минимума на шаге 210, затем взлетает до пика в районе шагов 280–300, примерно на два порядка выше впадины, и дальше медленно спадает. К финалу расхождение остаётся чуть выше значения на шаге инъекции, но все три условия идут вместе, не разделяясь ни на одном из 26 замеренных шагов. Тип содержимого, правда или выдумка, не оставляет различимого следа ни в середине, ни в конце.

Результат третий: правда и выдумка неотличимы

Зарегистрированный главный контраст сравнивал барьер лосса при интерполяции между готовой моделью и её близнецом для двух беглых условий. Барьер интерполяции показывает, насколько две сети функционально разошлись: берём прямую линию между весами, считаем лосс в 21 точке вдоль неё и смотрим максимальное отклонение от хорды. Разница между условиями составила +0,0068 при p равном 0,509, доверительный интервал от минус 0,0085 до плюс 0,026, и лишь три сида из восьми согласны по знаку. Минимальный детектируемый эффект здесь 0,032, а наблюдаемая разница составляет пятую часть от него. Отложенная кросс-энтропия тоже молчит: минус 0,00044 при p равном 0,31.

Проще говоря, для финальной модели не имеет значения, подтверждался ли факт в остальном корпусе. Выдумка и правда усваиваются одинаково, по крайней мере на этом масштабе и для этого типа утверждений. Четыре упоминания Никола в корпусе не дали его абзацу никакого измеримого преимущества перед Харрингтоном.

Пятнадцатикратное расхождение двух линеек

Самое интересное число статьи не про забывание, а про расстояние между способами измерения. Евклидово расстояние между финальными весами инъектированного прогона и его близнеца составляет 44,1% от расстояния между прогонами с разными сидами: 235 против 533 условных единиц. При этом 92% этого смещения накапливается уже к середине обучения, шагу 5 049, и дальше почти не меняется. А барьер лосса между теми же парами составляет всего 3,0% от межсидового барьера: 0,148 против 4,93.

Два измерения расходятся примерно в пятнадцать раз, и это нижняя оценка. Межсидовое евклидово расстояние раздуто перестановочной симметрией: сети с разных сидов считают почти одно и то же (послойное CKA от 0,88 до 0,99), но в фактически повёрнутом базисе, поэтому их «сырое» расстояние завышено. Выровняй базис, и знаменатель уменьшится, а отношение вырастет ещё сильнее.

Смысл такой: инъекция перемещает модель внутри её ложбины, не выводя из неё. Веса заметно переехали, поведение почти нет. Параметрическое измерение откликается на любое движение внутри бассейна и на выбор системы координат так же охотно, как на реальное изменение функции. Кто использует сдвиг весов как прокси для влияния данных, измеряет во многом шум устройства пространства параметров.

Что это значит для атрибуции данных и unlearning

Практические выводы цепляют сразу несколько областей. Верификация машинного забывания часто проверяется через разницу весов до и после процедуры: если веса «вернулись», считаем, что пример забыт. Эта работа показывает, что такая проверка мало о чём говорит: огромное движение весов совместимо с неизменным поведением, и наоборот, отсутствие функционального следа не означает, что веса не тронуты. Нужны поведенческие тесты, а не геометрия чекпоинтов.

Для функций влияния новость парадоксально мягкая. Они оценивают функциональную величину, изменение предсказаний, а именно она в эксперименте оказалась маленькой к концу обучения. Так что оценщики вроде TracIn или TRAK, прицеленные на готовую модель, вероятно, измеряли бы то самое «почти ничего», которое нашёл прямой замер. Проблема не в том, что методы расходятся, а в том, что ответ сильно зависит от момента измерения: через пятьдесят шагов после инъекции эффект огромный, к финалу его нет.

Есть и юридический оттенок. Аргумент «моя книга попала в датасет, значит, модель содержит мой текст» на этом масштабе не подтверждается для одиночного показа: к концу обучения функционального следа абзаца не находится даже чувствительными парными тестами. Это не оправдание скрапинга, а уточнение механизма: запоминание, которое находят в больших моделях, обычно связано с дублированием данных, а не с единичными встречами.

Ограничения, которые стоит держать в голове

Автор честно перечисляет слабые места. Масштаб маленький: 124 млн параметров и 2,5 млрд токенов, поведение моделей в сотни раз больше может отличаться, особенно у порога запоминания. Стимульная пара одна, два абзаца про Beatles, обобщать на «истину вообще» нельзя. Сетка барьера из 21 точки может пропускать узкие пики лосса, хотя перепроверка на вчетверо большем числе отложенных окон сдвинула барьеры примерно на один процент. И пререгистрация фиксировала контраст под формулировкой «истина против лжи», а переосмысление как «подтверждённость против выдумки» появилось уже после результата.

Часто задаваемые вопросы

Значит ли это, что модели вообще не запоминают данные?

Нет. Запоминание редких и продублированных последовательностей доказано множеством работ. Здесь измерен другой случай: один показ одного абзаца. Классические атаки извлечения данных работают именно на повторах, а не на единичных встречах, так что результаты не противоречат друг другу.

Почему нельзя просто масштабировать вывод на большие модели?

Потому что динамика забывания зависит от соотношения размера модели и корпуса. У GPT-2 на 124 млн параметров 2,5 млрд токенов дают примерно двадцать токенов на параметр, а современные фронтирные модели учатся в другом режиме. Методология парных детерминированных прогонов масштабируется, но стоит дорого: каждый факт требует полного контрольного прогона.

Чем эта работа отличается от исследования Butterfly?

Butterfly возмущала сами веса в выбранный шаг и мерила чувствительность траектории, а здесь возмущают данные, одну строку одного батча. Дизайн позаимствован, включая барьер интерполяции и евклидово расстояние, но вопрос другой: меняет ли контент строки, а не случайный толчок параметров, судьбу готовой сети.

Итог

Один абзац в 194 токена, подброшенный на пике learning rate, выучивается GPT-2 с одного показа, а к концу обучения его функциональный след стирается до статистической неразличимости, причём правда и выдумка исчезают одинаково. Веса при этом «помнят» вмешательство куда сильнее, чем поведение: 44% против 3% от межсидового масштаба. Если вы проверяете unlearning, атрибуцию или влияние данных по сдвигу весов, самое время перейти на поведенческие метрики. Код, пререгистрация и файлы измерений открыты в репозитории burst-study на GitHub, так что любой может повторить замер на своём сиде и убедиться лично.

← Все записи