Забавно наблюдать, как весь Твиттер взбудоражила новость о том, что Anthropic начал добавлять в тексты, сгенерированные своими моделями, невидимые водяные знаки.
Причём речь не о метаданных. Метка находится прямо внутри текста: её не видно глазами, она не меняет смысл или качество написанного и сохраняется даже после обычного копипаста.
Поскольку watermark создаётся на уровне самой модели, он должен появляться независимо от того, откуда вы обращаетесь к Claude: через API, приложение, Claude Code или облачные платформы Amazon, Google и Microsoft.
А для генерируемых файлов — PNG, SVG, JPG и других — теперь используется криптографическая подпись по открытому стандарту C2PA.
Всё это связано с комплаенсом. С 2 августа 2026 года европейский AI Act требует, чтобы контент, созданный ИИ, был машинно-различимым. Поэтому Anthropic пока маркирует только модели, выпущенные после этой даты. Старые модели находятся в переходном периоде и их тексты пока не помечаются.
Но как вообще можно спрятать водяной знак внутри слов?
Anthropic технические детали не раскрывает. Однако у Google уже около двух лет работает похожая технология SynthID-Text, поэтому принцип можно примерно представить.
Допустим, модель пишет:
«Утром выпил кофе и ___ на работу».
Варианты — «поехал», «пошёл», «отправился».
Секретный ключ вместе с предыдущими словами псевдослучайно делит доступный словарь на условно «зелёные» и «красные» токены. Модель при генерации немного чаще выбирает «зелёные».
Для человека текст выглядит абсолютно нормально.
А детектор, используя тот же ключ, анализирует статистику. Например, если в тысяче слов доля «зелёных» оказывается около 70%, хотя случайно ожидалось бы около 50%, появляется высокая вероятность, что текст был сгенерирован моделью.
Именно поэтому Anthropic предупреждает: на коротких текстах такая детекция работать надёжно не будет. А вот длинные исследования, статьи или дипломные работы уже дают достаточно статистики, чтобы метка могла проявиться.
Если Anthropic действительно использует что-то похожее на SynthID-Text, получаем довольно интересную ситуацию:
— Никакого списка «слов-маркеров» не существует. Раскраска пересчитывается для каждого следующего токена с учётом контекста.
— Найти watermark глазами невозможно: текст выглядит совершенно обычным.
— Короткие тексты и код маркировать сложнее, потому что детектору просто не хватает статистики и свободы выбора между вариантами.
— Даже если Claude не написал текст с нуля, а просто отредактировал или перевёл ваш собственный текст, watermark потенциально тоже может появиться. И сам Anthropic подчёркивает: наличие метки не доказывает авторство ИИ.
— Проверить наличие метки сможет только Anthropic. Собственный детектор они обещают описать в будущей документации.
И вот здесь самое интересное.
Все эти «хуманайзеры», попытки поменять стиль и промпты в духе «пиши как человек» могут оказаться практически бесполезными. Они меняют внешний стиль текста, а watermark находится не в стиле, а в статистике выбора токенов.
То есть проблема уже не в том, насколько текст «похож на ИИ».
Проблема в том, какой статистический след оставила сама модель.
По сути, надёжно убрать такую метку можно только пересоздав текст заново — например, через другую модель. Ну или воспользоваться машиной времени.
И ещё важный момент: тексты моделей, выпущенных до августа 2026 года, пока находятся в переходном периоде и, насколько известно сейчас, этим способом не маркируются.