Как ChatGPT выбирает источники для ответа 🔍
Меня часто спрашивают: почему один сайт попадает в ответ ChatGPT, а другой — нет? Оба в топе Google, оба с хорошим контентом. Но нейросеть выбирает только один.
Чтобы ответить честно, нужно разобраться, как устроен процесс изнутри.
Два режима — два разных механизма
ChatGPT работает в двух режимах, и их часто путают.
Первый — генерация из обученной модели. Здесь нет поиска в реальном времени. Модель отвечает на основе того, что было в обучающих данных: огромный массив текстов, собранных до определённой даты отсечения. Если ваш сайт существовал до этой даты и был достаточно представлен в открытом интернете — вы могли попасть в «память» модели. Но контролировать это напрямую нельзя.
Второй — поиск с RAG. Это Retrieval-Augmented Generation: сначала система ищет актуальные фрагменты через поисковый индекс, потом генерирует ответ на их основе. Именно здесь пользователь видит «источники» со ссылками. И здесь у вас уже есть реальные рычаги влияния.
Что именно ищет система при RAG
Поиск идёт не по сайтам целиком. Система разбивает документы на фрагменты и ищет те, которые семантически ближе всего к запросу. Не по ключевым словам — по смыслу.
Выигрывает не тот, у кого больше текста, а тот, у кого конкретный абзац точно отвечает на конкретный вопрос. Длинная статья-портянка проигрывает короткому, но плотному разделу с чётким ответом.
Дальше система оценивает фрагмент: насколько он структурирован, есть ли факты и конкретика, можно ли его понять без контекста остальной страницы. Последнее особенно важно. Фрагмент вырывается из окружения — и если он не самодостаточен, система его отбросит.
Авторитетность домена тоже играет роль. Не «красивый сайт», а насколько на него ссылаются другие, насколько он представлен в индексе, насколько свежий. Во многом это перекликается с классическими сигналами доверия в поиске, но алгоритм применяет их иначе.
Почему «хороший контент» — недостаточный критерий 🤔
Я вижу это регулярно. Компания вложила деньги в экспертные статьи — глубокие, с аналитикой, написанные живым языком. Но в ответ ChatGPT попадает конкурент с более скромным текстом.
Причина чаще всего не в качестве как таковом. Причина в структуре.
Если материал написан как лонгрид для журнала — с плавными переходами, вводными разделами, художественными отступлениями — нейросеть плохо вычленяет из него конкретный ответ. Она ищет чёткость. Подзаголовок, за которым сразу следует суть. Список, который можно извлечь и процитировать. Определение, которое стоит отдельным предложением.
Ещё момент — уникальность информации. Если фрагмент говорит то же самое, что и десятки других страниц, у системы нет причин выбрать именно вас. Собственные данные, кейсы, конкретные наблюдения создают отличие на уровне алгоритма, а не только на уровне читателя.
Что из этого следует на практике
Пишите так, чтобы любой абзац работал сам по себе. Если вырвать его из статьи и показать незнакомому человеку, он должен понять суть без предыстории.
Структура важнее объёма. Подзаголовки, короткие абзацы, конкретные формулировки. Не «мы помогаем бизнесу расти», а «мы сокращаем цикл сделки с трёх недель до пяти дней».
Работайте с упоминаниями. Чем больше внешних источников ссылается на ваш материал — тем выше его вес в глазах системы. Путь не быстрый, но надёжный.
И проверяйте вручную. Задайте запрос от имени своего клиента в ChatGPT с включённым поиском. Посмотрите, кого система цитирует. Это прямая подсказка, что нужно доработать.
Алгоритм не читает ваш сайт как редактор. Он ищет фрагменты, которые закрывают запрос точнее других. Если ваш контент устроен так — вы в игре.