Claude ставит водяные знаки: Anthropic маркирует весь текст
Anthropic стала первой крупной AI-лабораторией, которая начала встраивать невидимые водяные знаки прямо в текст, который генерирует Claude. Не ради научного эксперимента и не по собственной инициативе, а потому что этого требует европейское регулирование. Это тихое, но очень важное изменение: с этого момента каждый достаточно длинный ответ Claude несёт в себе скрытую метку, которую может проверить любой, у кого есть ключ.
Что такое водяной знак в тексте LLM
Водяной знак (watermark) в генеративном тексте это статистический паттерн в выборе слов, незаметный для читателя, но обнаружимый алгоритмически. В отличие от метаданных или вставки специальных символов, такая метка живёт внутри самого текста: в том, какие именно слова модель выбрала из нескольких равнозначных вариантов. По сути, модель подписывает свою работу почерком, а не печатью.
Идея не нова. Исследования статистической маркировки генеративного текста идут как минимум с 2023 года, когда группа из Университета Мэриленда показала схему с «зелёными списками» токенов: на каждом шаге генерации словарь модели псевдослучайно делится на разрешённую и запрещённую части, и модель чуть чаще выбирает слова из разрешённой. Смещение мизерное, на уровне долей процента перплексии, поэтому текст остаётся естественным, но на длине в несколько сотен слов перекос становится статистически доказуемым. Google DeepMind довела подход до продукта: их SynthID Text маркирует вывод Gemini и описан в статье в Nature. Но до сих пор ни одна лаборатория не включала маркировку для всех пользователей по умолчанию как элемент регуляторного комплаенса. Anthropic стала первой.
Как работает маркировка Claude
Механику Anthropic описала в своём блоге, и она элегантнее, чем можно было ожидать. Большая языковая модель генерирует текст по одному слову за раз, каждый раз выбирая из списка кандидатов. Во многих позициях выбор почти безразличен для смысла: «быстрый» или «скорый», «поэтому» или «так что». Именно эти низкорисковые развилки и использует водяной знак.
При обычной генерации модель выбирает слово с помощью обычного генератора случайных чисел. При маркировке источник случайности другой: выбор определяется секретным ключом и несколькими предыдущими словами контекста. Текст выглядит естественно, но последовательность таких «случайных» выборов образует паттерн. Читатель его не видит, а тот, кто владеет ключом, может статистически проверить, генерировал ли этот текст Claude.
Важно понимать, что это не криптографическая подпись в строгом смысле и не метка в метаданных файла. Паттерн распределён по всему тексту, его нельзя вырезать одной правкой, но и нельзя проверить без ключа. Публичной верификации, судя по всему, не будет: право определять авторство Claude остаётся за Anthropic и теми, кому она выдаст ключи.
Когда метка появляется, а когда нет
Anthropic довольно честно описывает границы метода, и они существенны. Водяной знак привязывается только к тем словам, которые выбрала сама модель. Если Claude вычитывает текст, написанный человеком, и слегка редактирует его, почти все слова остаются человеческими, и метке просто не за что зацепиться. Чем больше модель пишет сама, тем больше в тексте точек выбора и тем надёжнее маркировка.
С кодом ситуация похожая. В местах, где есть произвольный выбор, например в комментариях или именовании, знак может присутствовать. Но сам исполняемый код жёстко ограничен синтаксисом, поэтому влияние маркировки на него по определению ничтожно. Короткие ответы в пару предложений тоже почти не маркируются: слишком мало развилок для статистики.
Ещё одна деталь, которую легко пропустить: маркировка вступает в силу с будущих моделей Claude, а не с текущих. Это означает, что весь текст, сгенерированный до этого момента, остаётся немаркированным, и ретроспективно ничего проверить нельзя.
Причина: статья 52 EU AI Act
Зачем Anthropic это понадобилось? Ответ кроется в европейском регулировании. Статья 52 AI Act требует, чтобы контент, сгенерированный ИИ, был помечен как машинный, а Кодекс практики по прозрачности ИИ-контента детализирует, как именно это делать. Основные обязательства по прозрачности начинают применяться в августе 2026 года, и Anthropic движется навстречу дедлайну, а не дожидается штрафов.
Сама по себе логика регулятора понятна: информационное пространство заполняется синтетическим текстом, и у общества должен быть способ отличать его от человеческого. Проблема в исполнении. Технически работоспособных способов пометить текст, который нельзя смыть одной правкой, почти нет. Статистический водяной знак это, пожалуй, лучший из существующих вариантов, и Anthropic фактически первой сделала его обязательным элементом продукта.
Здесь есть и прагматичный расчёт. Штрафы по AI Act достигают 35 миллионов евро или 7% мирового оборота, а репутационные издержки от конфликта с европейским регулятором для компании, которая продаёт «безопасный ИИ» корпоративным клиентам, были бы ещё выше. Ранняя и публичная имплементация превращает обязательство в актив: когда требования вступят в силу для всех, Anthropic уже год как будет соответствовать, а конкуренты начнут догонять.
Почему только Anthropic
Вот где начинается самое интересное. Обязательства AI Act распространяются на всех провайдеров, работающих в ЕС, то есть формально маркировать вывод должны и OpenAI, и Google, и Meta. Но Google молча внедряет SynthID и не делает из этого историю, OpenAI, по сообщениям прессы, ещё в 2022 году имела готовый прототип текстового водяного знака и так и не решилась его включить, опасаясь оттока пользователей. Anthropic оказалась единственной, кто сделал это публично, с объяснением механики и рамкой комплаенса.
Возможны два прочтения. Первое: Anthropic последовательно реализует свою стратегию «компания, которой можно доверять», превращая регуляторное бремя в репутационное преимущество. Второе, менее лестное: компания первой сдалась регулятору и нормализовала практику, к которой остальные относятся с холодной неохотой. Как часто бывает, верны оба прочтения одновременно.
Спорные моменты
Первый вопрос: влияет ли маркировка на качество текста. Anthropic утверждает, что нет, но тут же признаёт, что источник случайности при выборе слов меняется. Это значит, что вывод по определению другой, пусть и в низкорисковых местах. Для большинства задач разница незаметна, но утверждение «никакого влияния» математически некорректно, и в блоге компании это фактически признаётся.
Второй вопрос серьёзнее: что даёт Anthropic возможность проверять авторство любого текста на принадлежность к Claude. С одной стороны, это инструмент против дезинформации и академического мошенничества. С другой, это механизм отслеживания, и история показывает, что такие механизмы со временем находят применения, о которых при создании никто не думал. Детекторы ИИ-текста и без того печально известны ложными срабатываниями, когда человеческий текст называют машинным. Теперь появится эталонный детектор от самого производителя, чьи ошибки будут восприниматься как истина.
Третий вопрос: обход. Любой статистический водяной знак ослабевает при парафразировании, переводе туда-обратно или редактуре другой моделью. Тот самый сценарий, где человек пишет сам, а Claude только вычитывает, уже сегодня признан Anthropic как не маркируемый. Получается, что метка надёжно обнаруживает честное использование и почти бессильна против намеренного обхода. Это свойство не только схемы Anthropic, а всего класса методов, но регулятору об этом как-то не принято говорить.
Что это значит для пользователей и разработчиков
Для обычного пользователя Claude в обозримом будущем не изменится ничего: текст останется таким же читаемым, скорость и цена не пострадают. Изменения коснутся тех, кто использует сгенерированный текст в публичном поле. Тексты от Claude станут верифицируемыми, и заявления вида «это писал человек» в отношении маркированного текста перестанут быть безопасными.
Для разработчиков, строящих продукты на API Claude, появляется новое измерение риска. Если ваш продукт генерирует контент от имени пользователей, этот контент будет нести метку происхождения, и скрыть это будет невозможно без искажения текста. В некоторых юрисдикциях это превратится из особенности в требование, так что архитектурно разумно уже сейчас считать маркировку данностью, а не опцией.
Шире всего это читается как часть тренда: индустрия переходит от добровольных обещаний к встроенной прослеживаемости. Водяные знаки в тексте, content credentials в изображениях, аппаратные аттестации в железе. Показательно, что в ту же неделю OpenAI запустила Computer History, функцию, которая с согласия пользователя записывает действия на компьютере, чтобы ChatGPT мог предлагать автоматизации. Microsoft пару лет назад попыталась выпустить похожий Recall и была разгромлена критикой за угрозу приватности. То есть одна компания маркирует то, что пишет модель, а другая записывает то, что делает пользователь. Направление одно: синтетический контент и цифровое поведение перестают быть анонимными, и Anthropic просто сделала этот переход первой и публично.
Часто задаваемые вопросы
Можно ли увидеть или удалить водяной знак в тексте Claude?
Нет. Знак это статистический паттерн в выборе слов, а не символы или метаданные. Удалить его можно только существенно переписав текст, например через парафразирование другой моделью, но тогда это уже фактически другой текст.
Будет ли Anthropic публично определять, чей это текст?
Нет, проверка требует секретного ключа, который остаётся у Anthropic. Компания позиционирует это как инструмент прозрачности по требованию регуляторов и партнёров, а не как публичный детектор вроде тех, что используют вузы.
Почему OpenAI и Google не делают так же?
Google уже маркирует Gemini через SynthID, просто без публичной кампании. OpenAI, по сообщениям прессы, годами откладывала запуск текстового водяного знака из-за страха оттока пользователей. Обязательства EU AI Act с августа 2026 года, вероятно, подтолкнут всех к аналогичным решениям.
Распространяется ли маркировка на корпоративные API?
Да, механизм работает на уровне генерации токенов, поэтому знак появляется в любом достаточно длинном тексте, независимо от канала доступа. Для корпоративных клиентов это скорее плюс: маркировка упрощает собственный комплаенс и позволяет доказать происхождение контента аудиторам.
Итог
Anthropic первой из крупных лабораторий превратила водяные знаки из исследовательской темы в обязательную функцию продукта, и сделала это под давлением статьи 52 EU AI Act. Механизм продуман: маркируется только то, что модель написала сама, код и редактура человеческого текста почти не затрагиваются. Но открытые вопросы остались: о влиянии на вывод, о том, кто и как будет пользоваться правом проверки, и о том, насколько такая маркировка устойчива к намеренному обходу. Если вы строите продукт на генеративных моделях, самое время решить, как вы будете работать в мире, где каждый сгенерированный абзац несёт метку происхождения.