Много лет robots.txt говорили краулерам лишь одно: "Вы можете сканировать этот сайт" или "Вы не можете".

Но ИИ изменил правила игры, так как теперь боты не только сканируют, но и обучаются, генерируют ответы и повторно используют контент так, как традиционные краулеры не делали. Новая политика Content Signals Policy от Cloudflare добавляет три новых флага, позволяющих четко обозначить:

search: ваш контент может появляться в результатах поиска ai-input: ИИ системы могут использовать ваш контент для генерации ответов ai-train: ваш контент может использоваться для обучения моделей

По умолчанию Cloudflare ставит search = да, ai-train = нет, а ai-input оставляет нейтральным, но вы можете настроить это в robots.txt.

Хотя enforcement (принудительное соблюдение) пока серое, и ИИ-боты могут игнорировать эти правила, Cloudflare позиционирует это как право владельцев сайта на контент, нарушение которого может иметь юридические последствия. Таким образом, владельцы сайтов получают инструмент, чтобы решить, можно ли ИИ системам сканировать, обучаться на и использовать их контент — это заявка на контроль "это мое, спрашивайте, прежде чем использовать".

Сработает ли? Время покажет.

Вопрос: Увидите ли вы в обновлении robots.txt от Cloudflare (search, ai-input, ai-train) изменение в том, как вы управляете краулингом и защитой контента?