robots.txt останавливает не тех ботов

Раздел закрыт от ИИ, а бренд все равно пересказывают чужими словами

Seer Interactive проверили на практике: — Disallow работает против обучающих и AI-search-краулеров: GPTBot, ClaudeBot, Google-Extended, CCBot, OAI-SearchBot, Claude-SearchBot, PerplexityBot — он не останавливает прямой запрос. Человек спрашивает ассистента, и тот открывает страницу прямо в момент ответа — в декабре 2025 OpenAI убрала из документации формулировку о соблюдении robots.txt для ChatGPT-User; Perplexity прямо называет Perplexity-User агентом пользователя

Попадание в ответы Алисы управляет не YandexBot, а `YandexAdditional` (`YandexAdditionalBot`). Disallow для него убирает сайт из нейроответов, но оставляет в обычном поиске. Директива применяется от 2 до 14 дней. Прецедент был ещё в 2024-м. «Городские порталы» (E1, NGS, «Фонтанка») блокировали робота перед запуском «Нейро», заодно и GPTBot с ChatGPT-User

Что делать Развести правила для обучающих ботов, retrieval-агентов и превью-ботов это разные боты. Начать с Disallow как с теста, 30-90 дней смотреть логи и только при подтвержденной проблеме переходить к серверной блокировке. Закрыть YandexBot целиком, значит выпасть из поиска ради проблемы с ИИ-ответами

Источник: Seer Interactive, «Do LLMs respect robots.txt?» seerinteractive.com/insights/do-llms-respect-robots справка Яндекс Вебмастера по YandexAdditional; кейс «Городских порталов» (2024)

robots.txt останавливает не тех ботов | Сетка — социальная сеть от hh.ru