Anthropic помечает ИИ-тексты Claude невидимым клеймом.

Первая реакция любого нормального человека на фразу «невидимый водяной знак в тексте»: Погодите, это как вообще?! У изображения есть пиксели, в них можно спрятать сдвиг яркости на одну единицу — глаз не заметит, а алгоритм считает. У текста НЕТ пикселей. Есть только буквы, и они у всех на виду, блин.

Разгадка в том, что модель никогда не “печатает” текст, как машинистка. Она на каждом шаге держит в голове список кандидатов на следующее слово — с вероятностями. Вот в этом зазоре, между несколькими одинаково уместными словами, и существует технология.

Секретный ключ, известный только Anthropic, на каждом шаге делит список кандидатов на две произвольные группы — условно «зелёные» и «красные» — и слегка подталкивает модель выбирать из зелёных чуть чаще, чем предписывает случайность. Не запрещает красные — просто чуть занижает им шанс, так, незаметно. Один такой выбор — шум, ни о чём не говорящий. Но за тысячу слов текста накапливается статистическое смещение, которое у человека, не знающего ключа, просто невозможно случайно повторить с такой регулярностью.

Интересная история и вполне логично, что весь ИИ контент будет маркироваться, включая тексты. Поисковики, сами нейронки и контролирующие органы будут легко это отслеживать.

Правда сам метод вызывает вопросы. По идее, можно отследить какие-то паттерны, повторяющиеся слова, а значит взломать алгоритм. А если дать переписать текст другой ИИ? И что будет, если ИИ текст прошел ручную редактуру человеком? Часть меток сотрется? Будет ли такой текст считаться ИИшным? Вопросов пока много.

Anthropic помечает ИИ-тексты Claude невидимым клеймом | Сетка — социальная сеть от hh.ru