Водяные знаки ИИ: одна формула, которая объединила 21 схему маркировки контента

Водяные знаки ИИ: одна формула, которая объединила 21 схему маркировки контента

Представьте два водяных знака. Первый — Tree-Ring: алгоритм встраивает кольцо определённой формы в спектр начального шума диффузионной модели. Чтобы проверить изображение, достаточно инвертировать генерацию и найти это кольцо. Второй — Green-list: на каждом шаге генерации текста половина словаря окрашивается в «зелёный», и следующий токен статистически смещается к зеленой половине. Спрашиваем: можно ли в первом случае указать, где именно живёт метка? Да, инвертируй шум и читай кольцо. А во втором — какие токены являются меткой? Никак: каждый токен выглядит как естественный, метка существует только в статистическом aggregate всего текста. Это не техническая мелочь. Это граница между двумя фундаментально разными онтологиями, и свежая работа 2026 года превращает эту интуицию в точную математику.

Статья «Watermark Forensics for Generative Models: An Information-Theoretic Perspective», опубликованная в июле 2026 года, предлагает нечто большее, чем очередной метод детекции. Авторы строят универсальный фреймворк, в котором все 21 существующая схема (от Green-list и SynthID до SEAL и AudioSeal) описывается одним объектом. Назовём его информационным профилем.

Лестница из четырёх ступеней

Авторы формулируют четыре форензических вопроса, которые вообще можно задать водяному знаку, и располагают их лесенкой по нарастанию сложности.

Уровень 0 — детекция. Машина это сгенерировала или человек? Эта ступень к 2026 году уже хорошо изучена: при бюджете искажения Δ на каждый токен обнаружение стоит Θ(1/Δ) токенов, с точными константами. Авторы импортируют этот результат как базу и не доказывают его заново.

Уровень 1 — атрибуция. Какой из N пользователей произвёл этот контент? Вопрос критичен для регулирования: если модель сгенерировала опасный текст, нужно установить, кто именно запустил генерацию.

Уровень 2 — извлечение. Можно ли извлечь из метки скрытое сообщение длиной ℓ бит? Это превращает водяной знак из пассивного маркера в канал связи. Например, для встраивания идентификатора лицензии или хеша обучающих данных.

Уровень 3 — локализация. Какие именно части носителя несут метку? Если кто-то вырезал абзац из текста или обрезал изображение, можно ли найти границу правки?

Вся работа о том, что над нулевым уровнем (детекцией) все три оставшиеся ступени читаются из одного объекта.

Один объект — информационный профиль

Ключевая идея статьи помещается в одну строку. Каждый токен xₜ вносит количество информации I(S; Xₜ | X_<t) о секрете S — это информация, которую t-я позиция добавляет при известном прошлом. Авторы определяют функцию ν(t) = I(S; Xₜ | X_<t) и называют её информационным профилем схемы.

Масса профиля ‖ν‖₁ = I(S; X) ограничивает всё, что можно восстановить об атрибуте и извлечении. Форма профиля supp(ν) — носитель — определяет, можно ли локализовать метку. Детекция — единственное исключение: она не читает массу, она измеряет, насколько далеко маркированное распределение от естественного.

Из этой конструкции немедленно следуют две онтологии. Embedding-схемы (Tree-Ring, теоретический digit-stamp) концентрируют информацию на малом числе координат — o(n). Их секрет живёт в конкретных позициях: кольце в пространстве Фурье, наборе пикселей. Biasing-схемы (Green-list, SynthID, SEAL) размазывают информацию по всему носителю — Ω(n). Секрет не живёт нигде конкретно, он существует как статистический сдвиг.

И эта дихотомия не вопрос вкуса. Она определяет, что схема может и чего не может.

Теорема, которая всё расставляет по местам

Центральный результат — Theorem 3.3 — показывает, что для embedding-схем стоимость атрибуции составляет Θ(log N / log q) и не зависит от параметра искажения Δ. Это «Δ-free decoupling»: можно сделать метку сколь угодно незаметной, и цена атрибуции не вырастет. Для biasing-схем всё иначе: стоимость атрибуции равна Ω(log N / Δ) и расходится при Δ → 0. Чем незаметнее метка, тем дороже обходится атрибуция.

Регулятор, который требует маркировку «в машиночитаемом формате» (как EU AI Act, Art. 50), фактически предписывает embedding-онтологию. Даже если в тексте закона этого не написано. Biasing-схема может удовлетворить мандат на атрибуцию, но цена будет расти с каждым шагом к большей скрытности.

Вторая теорема — Theorem 3.12 — связывает footprint (носитель профиля) с разрешением локализации. Малый footprint (o(n) координат) несовместим с тонкой локализацией: единственная вставка разрушает метку. Схемы, которые действительно умеют локализовать правки (SEAL с 98.2% AUC, EditGuard, AudioSeal), работают не потому, что у них маленький footprint, а потому что у них full support с тонким per-region считыванием. Четвёртый квадрант — малый footprint + тонкая локализация — математически пуст. Его не существует.

Таксономия: где живут 21 существующая схема

Авторы классифицируют 21 deployed watermark по двум ортогональным осям. Первая — footprint: embedding (малый, o(n)) или biasing (полный, Ω(n)). Вторая — разрешение считывания: глобальное (статистика по всему носителю) или per-region (тонкое, по блокам).

Подавляющее большинство развёрнутых схем — biasing: Green-list, SynthID-Text, BiMark, Reweighting, Gaussian Shading, HiDDeN, Stable Signature, RingID, ROBIN. Настоящих embedding-схем — всего две: Tree-Ring (кольцо в пространстве Фурье) и теоретический digit-stamp.

Локализаторы (SEAL, EditGuard, AudioSeal) занимают правый верхний квадрант: полный носитель и тонкое считывание. Детекторы нулевого уровня (Green-list, SynthID, Reweighting) — левый нижний: полный носитель и глобальное считывание. Атрибуцию и извлечение поддерживают схемы с достаточной массой профиля — теоретически все biasing-схемы с ключом, но практически — те, у которых масса ‖ν‖₁ достаточна для логарифма числа пользователей.

Почему это нетривиально: коллизии и скорости Реньи

Чтобы понять, почему простая формула «больше информации = лучше атрибуция» не работает, нужно разобрать один тонкий момент. У водяного знака есть ключ K, и при декодировании нужно отличить истинный ключ от N−1 ложных. Когда мы проверяем согласованность ключа с носителем, возможны коллизии — ложные ключи тоже кажутся согласованными. Размер этого «ложно-согласованного списка» определяет скорость Реньи-2 r₂, а скорость принятия решения — Shannon rate h. Теорема 3.9 (Proposition в терминологии авторов) показывает: для forensic guarantee важна только скорость принятия решения, не размер списка коллизий. Наивный анализ мог бы предположить, что r₂ и h дают одинаковую сложность — но это не так. H ≤ r₂ всегда, и разрыв между ними — это разница между стоимостью решения и стоимостью поиска. В deployed-схемах этот разрыв часто скрыт, потому что декодер оптимизирован для «хорошего» режима, а forensic guarantee должна работать при любом носителе.

Открытые вопросы

Авторы честно маркируют границы. Главная нерешённая проблема — edit-robust distortion-free атрибуция. существующий декодер атрибуции проверяет согласованность токен-за-токеном, и единственная правка его разрушает. Если ослабить согласованность до edit-robust, истинный ключ перестаёт быть детерминированно согласованным, и открытый вопрос — остаётся ли стоимость log N / h (по Шеннону) или вырастает до log N / r₂ (по Реньи-2, где r₂ — скорость коллизий).

Второй открытый вопрос — verification versus search. Атрибуция в работе — это поиск: какой из N пользователей? Вариант «это пользователь u?» — композиционный бинарный тест, и литература по identification-via-channels предполагает, что верифицируемых подписей двойно экспоненциально больше, чем декодируемых. Это означало бы разрыв: верификация N-free, а поиск стоит Θ(log N / Δ).

Что это значит на практике

Для регулятора: если EU AI Act требует «machine-readable format», структура теоремы 3.3 говорит, что это предписание embedding-онтологии. Biasing-схемы — большинство deployed — не могут выполнить мандат на атрибуцию без растущей цены при повышении скрытности. Законодателям стоит знать, что они выбирают не просто формат, а математическую структуру.

Для разработчика: при выборе схемы водяных знаков решение сводится к вопросу, какие форензические уровни нужны. Если только детекция — достаточно biasing-схемы с глобальным считыванием (SynthID-Text, Green-list). Если нужна атрибуция пользователей — biasing с достаточной массой профиля. Если нужна локализация правок — только full-support с per-region readout (SEAL, EditGuard, AudioSeal). А попытка совместить малый footprint с локализацией математически обречена, теорема 3.12.

Для исследователя: информационный профиль ν(t) — это новый объект, с которым можно работать. Вместо того чтобы доказывать теоремы для каждой схемы отдельно, достаточно показать свойство функционала от ν. Это унификация, которая должна ускорить прогресс, как теория информации когда-то унифицировала понимание каналов связи.

Часто задаваемые вопросы

Можно ли подделать водяной знак?

Зависит от онтологии. Embedding-схемы (Tree-Ring) концентрируют метку в малом числе координат — их можно попытаться найти и удалить, если знать базис. Biasing-схемы размазаны по всему носителю: удаление метки означает переписывание всего текста или перерисовку всего изображения. Именно поэтому современные deployed-схемы — преимущественно biasing: они устойчивее к целевому удалению.

Почему бы не использовать все уровни одновременно?

Уровни делят единый бюджет информации ‖ν‖₁ = I(S; X). Теорема 3.1 (forensic-recovery budget) показывает: сумма информации, извлечённой на всех уровнях, не может превысить этот бюджет. Нельзя одновременно извлечь максимум атрибуции, максимум извлечения и максимум локализации. Они конкурируют за один ресурс.

Какой водяной знак выбрать для текстовой LLM?

Если цель — только детекция AI-контента, достаточно Green-list или SynthID-Text (biasing, глобальное считывание). Если нужна атрибуция до конкретного пользователя — biasing с ключевой регистрацией (Many-user от Cohen et al., 2025). Если нужна и детекция, и устойчивость к редактированию — PRC-схемы (Christ and Gunn, 2024). Локализация для текста пока остаётся открытой задачей: ни одна deployed текстовая схема не поддерживает Level 3.

Итог

Работа 2026 года превращает разрозненную область водяных знаков в структурированную дисциплину с единым языком описания. Один объект — информационный профиль ν(t) — определяет всё, что можно и нельзя извлечь из маркировки: массу для атрибуции и извлечения, форму для локализации, а детекция оказывается единственной форензической операцией, которая не читает профиль, а измеряет расстояние до естественного распределения. Двадцать одна deployed схема занимает три из четырёх квадрантов двумерной таксономии; четвёртый — малый footprint с тонкой локализацией — математически запрещён теоремой 3.12. Если вы занимаетесь регулированием AI-контента, разработкой систем маркировки или исследованиями в области AI safety — эта работа задаёт словарь и карту на годы вперёд. Начните с вопроса: какой форензический уровень вам действительно нужен. И выбор схемы станет очевидным.

← Все записи