ConceptGuard: почему модели не умеют забывать избирательно
Представьте, что вы просите языковую модель объяснить, как работает SQL-инъекция. В курсе по кибербезопасности это законный учебный вопрос. В запросе «напиши эксплойт для этого сайта» это инструкция для атаки. Знание одно и то же, а вот допустимость его применения зависит от контекста. Теперь вопрос на миллион: можно ли заставить модель «разучить» вредоносное применение концепции, сохранив полезное? Новый бенчмарк ConceptGuard (arXiv 2608.20338) впервые измерил именно это, и результаты для индустрии безопасности невесёлые.
Что такое машинное разучивание
Машинное разучивание (machine unlearning) это набор методов, которые удаляют из уже обученной модели влияние конкретных данных без полного переобучения с нуля. Задача возникла из практических требований: модели впитывают из корпусов обучения копирайтный контент, персональные данные и знания, которые позволяют вредоносное поведение. Регуляторы и собственная осторожность лабораторий требуют уметь это знание изымать.
Стандартная постановка выглядит так. Есть forget set, данные, которые надо забыть, и retain set, данные, которые надо сохранить. Модель сначала дообучают на объединении обоих наборов, затем применяют метод разучивания к forget set. Качество измеряют двумя метриками: forget quality показывает, перестала ли модель воспроизводить забываемое, а model utility проверяет, не пострадали ли общие способности. На этой схеме построены все известные бенчмарки: TOFU с вымышленными авторами книг, MUSE с текстами про Гарри Поттера и новостями, WMDP с опасными знаниями из биологии, химии и кибербезопасности.
В чём изъян существующих бенчмарков
Авторы ConceptGuard указывают на два структурных дефекта этой постановки, и оба сводятся к одному: бенчмарки измеряют не то, что нужно на практике.
Первый дефект в конструкции данных. Forget и retain наборы собираются как случайные непересекающиеся подмножества фактов. TOFU просто делит данные о вымышленных авторах в процентном соотношении. MUSE разрезает корпуса независимо. WMDP берёт опасные вопросы в forget set, а полезность меряет вообще на внешних тестах вроде MMLU. Нигде нет связи между тем, что забывается, и тем, что сохраняется. Для задач приватности, где нужно стереть конкретную запись о конкретном человеке, это нормально. Для безопасности это бессмысленно: знание о синтезе химических соединений вредоносно в одном контексте и необходимо в учебном или промышленном.
Второй дефект в оценке. Существующие протоколы проверяют воспроизведение изолированных фактов: вероятность токенов, ROUGE против эталона, точность на вопросах с выбором ответа. Они не проверяют главного: умеет ли модель после разучивания применять ту же концепцию по-разному в зависимости от намерения запроса. Модель может получить отличные баллы, просто подавив концепцию целиком, и это будет выглядеть как успех, хотя на деле она потеряла и полезное применение.
Идея ConceptGuard: концепции двойного назначения
ConceptGuard меняет постановку с удаления фактов на удаление применений. В основе лежит понятие dual-use концепции: знания, которое одинаково легко использовать во вред и на пользу в зависимости от контекста, формулировки и намерения. Кибербезопасность, социальная инженерия, работа с блокчейном, биохимические процессы: всё это концепции двойного назначения.
Ключевое отличие в том, что forget и retain наборы здесь не независимы, а взаимодополняющи. Для каждой концепции forget set содержит вредоносные применения, а retain set содержит доброкачественные применения той же самой концепции. Забывание становится проверкой безопасности напрямую, а полезность проверяет сохранение правильного поведения внутри той же концептуальной области.
Датасет собран в несколько стадий с ручным контролем. За основу взяли LLM-LAT, набор промптов, провоцирующих небезопасное поведение, с ответами GPT-3.5. Классификатор на базе GPT-5 определял, какие промпты отражают вредоносное применение dual-use концепции, отсекая заведомо злонамеренные узкие сценарии вроде биотерроризма. Похожие концепции объединяли вручную: SQL-инъекции и эксплуатация баз данных слились в одного родителя. Затем для каждого вредоносного примера GPT-5 под надзором генерировал доброкачественного двойника сопоставимой длины и структуры. Итог: 5166 примеров, поровну вредоносных и безопасных. Самые частые концепции: кибербезопасность (302 примера), социальная инженерия (219), дезинформация (103). Это точное отражение реальных проблемных доменов, а не академические игрушки.
Как измеряют: три группы метрик
Протокол оценки строится вокруг двух привычных осей плюс одной новой. Качество забывания измеряется тремя способами: дословное воспроизведение вредоносных текстов по префиксу через ROUGE-L, ответы на вредоносные запросы против эталонов, и оценка вредоносности ответов судьёй на базе LLM. Полезность зеркально: дословное удержание безопасных текстов и качество ответов на доброкачественные запросы.
Главная новизна это метрика контекстного разделения, contextual separation. Она измеряет, насколько модель разводит вредоносное и безопасное применение одной концепции: отказ на вредный запрос плюс корректный ответ на безопасный. Именно эта метрика и есть операционализация «настоящего безопасного разучивания» по мнению авторов. Для судейства использовали GPT-5.4 вместо GPT-5, чтобы избежать циркулярности: датасет-то генерировался GPT-5.
Эксперимент: четыре метода, две модели, ноль победителей
Тестировали четыре представительных метода разучивания. Gradient Ascent, классический базлайн, максимизирует лосс на forget set с параллельным градиентным спуском на retain set. SimNPO, метод на предпочтениях, штрафует вероятность вредоносных ответов без референсной модели. RMU работает на уровне представлений, сдвигая внутренние активации для вредоносных данных и сохраняя активации для безопасных. UNDIAL применяет самодистилляцию, понижая веса вредоносных токенов в выходном распределении. Модели: Qwen-2.5-3B-Instruct и Llama-3.1-8B-Instruct.
Результаты по LLM-судье показывают жёсткий trade-off. Gradient Ascent действительно забывает лучше всех: HarmScore на Qwen падает на 36% относительно базовой модели. Но цена катастрофическая: HelpScore рушится на 76%, а контекстное разделение падает на 95%. Метод не разделяет применения, он выжигает концепцию целиком вместе с полезными знаниями. На Llama картина мягче, но HelpScore всё равно проседает на 15%.
SimNPO и RMU выглядят сбалансированнее. На Qwen SimNPO даёт лучшее разделение 0.34, рост на 79% к базе, при сохранении приличной полезности. На Llama лидирует RMU с разделением 0.38, плюс 73%. Авторы отмечают, что формулировка через предпочтения работает как эффективная стратегия безопасного разучивания: модель учится «не хочу отвечать так», а не «не знаю этого». UNDIAL занимает промежуточное положение, но его результаты улучшаются с ростом масштаба модели, что намекает на потенциал для больших сетей.
Звучит обнадёживающе, пока не смотришь на абсолютные значения. Лучшее разделение 0.38 означает, что даже чемпион справляется с разведением контекстов едва ли в трети случаев. Ни один метод не достиг того, что авторы называют truly safe unlearning.
Концепции сопротивляются по-разному
Самый интересный срез работы это анализ по отдельным концепциям. Разделение сильно варьируется: анонимность и социальные сети стабильно показывают максимальный разброс между методами. Авторы объясняют это тем, что концепции, завязанные на человеческое поведение в конфликтных контекстах, по своей природе труднее разучивать равномерно.
При этом у методов есть «специализации». SimNPO лучше справляется с концепциями, которые формулируются как предпочтения или намерения: анонимность, социальная инженерия. RMU сильнее на системных и операционных темах: автоматизация, телекоммуникации. Gradient Ascent и UNDIAL ведут себя хаотично без устойчивого паттерна. Не существует фиксированного набора концепций, которые стабильно разделялись бы всеми методами на всех масштабах.
Отдельно проверили гипотезу «может, просто уменьшить forget set?». Сокращение доли забываемых данных при неизменном retain set даёт лишь маргинальный прирост разделения, и тот объясняется возросшим влиянием retain set на оценку полезности, а не реальным улучшением. Рейтинг методов не меняется. Вывод: масштабированием данных проблему не решить, нужны методы, изначально заточенные под контекстное разделение.
Как устроен эксперимент изнутри
Важно понимать двухстадийную схему, потому что она воспроизводит реальный сценарий. Сначала базовую инструктивную модель дообучают на объединении forget и retain наборов, то есть намеренно внедряют и вредоносное, и безопасное поведение. Только после этого применяют разучивание к forget set. Это честнее, чем проверка на модели, которая «и так не знает» вредоносного: здесь знание точно присутствует, и вопрос в том, можно ли его изъять хирургически.
Для оценки авторы построили отдельные наборы запросов: с вредоносным намерением и с доброкачественным, по одному на каждый обучающий пример. Так проверяется не дословная память, а поведение в диалоге. Сравнение с существующими бенчмарками показательно и по масштабу: TOFU оперирует десятью тысячами коротких QA-пар про выдуманных авторов, MUSE тысячей книг и 27 тысячами новостных фрагментов, WMDP тремя тысячами вопросов с вариантами ответа. ConceptGuard скромнее по размеру, но единственный тестирует успех и провал внутри одной концептуальной области, а не на разных доменах.
Почему это важно
Индустрия продаёт unlearning как готовую фичу соответствия требованиям: удалил данные, отчитался перед регулятором, спишь спокойно. ConceptGuard показывает, что текущие методы дают иллюзию контроля. Модель либо забывает слишком много и тупеет, либо забывает факты, но не применения: спроси то же знание под безобидным соусом, и она выдаст вредоносное содержание. Для компаний, которые строят политику безопасности на WMDP-подобных метриках, это неприятный сигнал: высокие баллы на старом бенчмарке не гарантируют безопасного поведения в реальных диалогах.
Практический вывод для тех, кто оценивает unlearning в своих продуктах: смотрите не на ROUGE забытого, а на поведение модели на парных запросах внутри одной концепции. Датасет ConceptGuard открыт, так что проверить можно уже сейчас.
Часто задаваемые вопросы
Чем ConceptGuard отличается от WMDP?
WMDP проверяет снижение точности на опасных вопросах с выбором ответа, а полезность меряет на посторонних тестах вроде MMLU. ConceptGuard строит парные наборы: вредоносное и безопасное применение одной концепции, и измеряет, разводит ли модель контексты. Это проверка поведения, а не памяти.
Какой метод разучивания лучший по результатам бенчмарка?
Единственного победителя нет. Gradient Ascent забывает сильнее всех, но разрушает полезность. SimNPO и RMU дают лучший баланс и высшее контекстное разделение (0.34 и 0.38 на двух моделях), что всё равно далеко от надёжного разделения. Выбор зависит от того, что важнее: безопасность или сохранение способностей.
Что такое концепция двойного назначения?
Это знание, применимое и во вред, и на пользу в зависимости от контекста и намерения. Примеры: кибербезопасность, социальная инженерия, биохимия. Цель безопасного разучивания не стереть такую концепцию целиком, а заблокировать только вредоносные применения, сохранив легитимные. Именно поэтому тотальное подавление, которое демонстрирует Gradient Ascent, формально решает задачу забывания, но проваливает задачу безопасности: модель теряет и то, что должна была сохранить.
Можно ли использовать ConceptGuard для своих моделей?
Да, датасет открыт, авторы прямо указывают на это в статье. Протокол воспроизводим: дообучение на объединённых данных, применение метода разучивания, затем оценка по вредоносным и доброкачественным запросам. Для судейства потребуется сильная LLM, но ROUGE-метрики считаются и без неё.
Итог
ConceptGuard смещает рамку машинного разучивания с «забыл ли модель факт» на «понимает ли модель, когда знание применять нельзя». Пять тысяч парных примеров по концепциям двойного назначения показали: все четыре современных метода unlearning проигрывают в главном, они не умеют разделять контексты. Либо выжигают концепцию целиком, либо забывают факты без поведения. Если ваша стратегия безопасности опирается на unlearning, самое время прогнать свои модели через этот бенчмарк и посмотреть на числа без розовых очков.