Почему нейросеть цитирует ваш абзац, а не вашу статью?
Потому что она вашу статью целиком никогда не читала. Это первое, что я объясняю на каждой консультации, когда слышу: «у нас отличный контент, а в ответах нейросетей нас нет».
Разберём механику. ChatGPT с поиском, Perplexity и нейроответы Яндекса работают по схеме RAG — retrieval-augmented generation, «генерация с дополнением через поиск». Модель не запоминает страницы целиком: она заранее режет их на фрагменты по 200–500 слов — чанки — и превращает каждый в числовой вектор, эмбеддинг. Вектор хранит смысл фрагмента, а не его слова.
Дальше по запросу пользователя система ищет не «вашу страницу», а несколько векторов, ближайших по смыслу к вопросу. Отбирает 3–5 лучших и на их основе собирает ответ. Всё, что не превратилось в извлекаемый фрагмент, для нейросети не существует.
Тема разобрана в российских источниках: у Яндекса в блоге Облака есть базовая статья про RAG, у Сбера — разбор технологии и этапов внедрения, на Хабре — полный разбор от теории до практики, а на vc.ru выходил материал о том, как чанкинг влияет на попадание сайтов в ответы ИИ. Прочитаете — сразу поймёте, почему я так зациклен на структуре.
Теперь главное. Если в ответ попадает фрагмент, а не страница — каждый абзац вашего текста должен выживать в одиночестве. Его вырвали из статьи и показали без контекста — он обязан остаться понятным, нести законченную мысль и отвечать на один конкретный вопрос. Абзац со словами «как уже говорилось выше» или «в этом разделе рассмотрим» для извлечения — мусор.
Что я советую всем, кто пишет контент под нейросети: • один абзац — один вопрос . Две темы в абзаце — режьте на два; • прямой ответ — в первых двух предложениях. Не «стоимость зависит от многих факторов», а «ремонт ванной под ключ в Москве — от 45 000 рублей»; • абзацы по 100–190 слов. Длиннее — разрежут посередине мысли; • заголовки H2/H3 — это имена будущих чанков. Пусть в них будет вопрос, а не «Раздел 3»; • списки, таблицы, цифры нейросеть извлекает охотнее, чем сплошную прозу; • формулировки — как у пользователей, а не «по-научному». Эмбеддинги ищут по смыслу, но размытые формулировки ловят плохо: клиенты спрашивают «сколько стоит замена масла», а у вас «стоимость ТО двигателя» — шанс, что фрагмент найдут, падает; • обновляйте контент. Свежесть влияет на цитируемость напрямую: страница, которую не трогали два года, из выборки выпадает.
И это не теория. Проверьте сами за полчаса: откройте ChatGPT, Perplexity и YandexGPT, задайте 5–10 вопросов из вашей ниши — теми словами, которыми спрашивают клиенты. Посмотрите, какие фрагменты и чьи сайты цитируются. Потом возьмите свой лучший абзац и задайте тот же вопрос. Не совпало — переписывайте заголовок абзаца и первые предложения под реальные запросы.
Моё убеждение за годы практики: «контент для людей» и «контент для нейросетей» — больше не разные вещи. Люди тоже любят, когда им отвечают сразу, без воды и с цифрами. Просто раньше за расплывчатый текст вас никто не наказывал, а теперь наказывает — отсутствием в ответах ИИ.
Кто пишет чётко и структурно, того цитируют. Кто пишет «красиво» — того пропускают.