Забавно наблюдать, как весь Твиттер взбудоражила новость о том, что Anthropic начал добавлять в тексты, сгенерированные своими моделями, невидимые водяные знаки.

Причём речь не о метаданных. Метка находится прямо внутри текста: её не видно глазами, она не меняет смысл или качество написанного и сохраняется даже после обычного копипаста.

Поскольку watermark создаётся на уровне самой модели, он должен появляться независимо от того, откуда вы обращаетесь к Claude: через API, приложение, Claude Code или облачные платформы Amazon, Google и Microsoft.

А для генерируемых файлов — PNG, SVG, JPG и других — теперь используется криптографическая подпись по открытому стандарту C2PA.

Всё это связано с комплаенсом. С 2 августа 2026 года европейский AI Act требует, чтобы контент, созданный ИИ, был машинно-различимым. Поэтому Anthropic пока маркирует только модели, выпущенные после этой даты. Старые модели находятся в переходном периоде и их тексты пока не помечаются.

Но как вообще можно спрятать водяной знак внутри слов?

Anthropic технические детали не раскрывает. Однако у Google уже около двух лет работает похожая технология SynthID-Text, поэтому принцип можно примерно представить.

Допустим, модель пишет:

«Утром выпил кофе и ___ на работу».

Варианты — «поехал», «пошёл», «отправился».

Секретный ключ вместе с предыдущими словами псевдослучайно делит доступный словарь на условно «зелёные» и «красные» токены. Модель при генерации немного чаще выбирает «зелёные».

Для человека текст выглядит абсолютно нормально.

А детектор, используя тот же ключ, анализирует статистику. Например, если в тысяче слов доля «зелёных» оказывается около 70%, хотя случайно ожидалось бы около 50%, появляется высокая вероятность, что текст был сгенерирован моделью.

Именно поэтому Anthropic предупреждает: на коротких текстах такая детекция работать надёжно не будет. А вот длинные исследования, статьи или дипломные работы уже дают достаточно статистики, чтобы метка могла проявиться.

Если Anthropic действительно использует что-то похожее на SynthID-Text, получаем довольно интересную ситуацию:

— Никакого списка «слов-маркеров» не существует. Раскраска пересчитывается для каждого следующего токена с учётом контекста.

— Найти watermark глазами невозможно: текст выглядит совершенно обычным.

— Короткие тексты и код маркировать сложнее, потому что детектору просто не хватает статистики и свободы выбора между вариантами.

— Даже если Claude не написал текст с нуля, а просто отредактировал или перевёл ваш собственный текст, watermark потенциально тоже может появиться. И сам Anthropic подчёркивает: наличие метки не доказывает авторство ИИ.

— Проверить наличие метки сможет только Anthropic. Собственный детектор они обещают описать в будущей документации.

И вот здесь самое интересное.

Все эти «хуманайзеры», попытки поменять стиль и промпты в духе «пиши как человек» могут оказаться практически бесполезными. Они меняют внешний стиль текста, а watermark находится не в стиле, а в статистике выбора токенов.

То есть проблема уже не в том, насколько текст «похож на ИИ».

Проблема в том, какой статистический след оставила сама модель.

По сути, надёжно убрать такую метку можно только пересоздав текст заново — например, через другую модель. Ну или воспользоваться машиной времени.

И ещё важный момент: тексты моделей, выпущенных до августа 2026 года, пока находятся в переходном периоде и, насколько известно сейчас, этим способом не маркируются.