Как работает Google? 🔎

Результаты недавнего судебного разбирательства, раскрыли тайны внутренней работы Google.

Основы поиска

1. Краулинг и индексация

— Только Google и Bing имеют полноценные индексы для веб-поиска — У Apple есть большой индекс, но они не используют его для выдачи 😲

2. Понимание запросов

Google использует несколько стратегий для понимания пользовательских запросов:

— Выявление ошибок в написании — Аннотирование синонимами — Маркировка многословных концепций — Отметка связанных терминов — Кластеризация и сегментация запросов

Ключевая система в этом процессе - Query-based Salient Terms (QBST).

3. Извлечение и ранжирование

— Google извлекает несколько тысяч страниц из индекса для каждого запроса — Только эти извлеченные страницы попадают в фазу ранжирования — Ваша страница может быть проиндексирована и релевантна, но все равно не рассматриваться для ранжирования.

Классификация запросов и поведение пользователей

— Google классифицирует запросы по тематике, минимум на два десятка основных топиков — Пользователи обычно ищут в рамках одной широкой темы в течение коротких периодов — Запросы классифицируются как коммерческие или некоммерческие — 80% запросов в Google - некоммерческие — Топ-5 запросов по объему поиска - навигационные.

Стоимость инноваций

— Добавление фич вроде видеопоиска в выдачу дорого, но необходимо для генерации дохода — Эта высокая стоимость входа отпугнула многие стартапы от конкуренции на рынке поисковиков.

Добавление видеопоиска в СЕРП стоит примерно в пять раз дороже на запрос, чем просто веб-поиск.

Пользовательские данные

Google использует различные типы пользовательских данных:

— Данные о кликах (на какие результаты кликают, как долго остаются, паттерны скроллинга) — Данные о запросах (что ищут пользователи)

Из 3,7 миллионов уникальных фраз запросов в Google и Bing, 93% уникальных фраз видел только Google, против 4,8%, которые видел только Bing.

Взаимодействия пользователей и данные о запросах помогают Google:

— Оценивать релевантность и качество результатов — Улучшать стратегии краулинга и индексации — Обеспечивать полный охват частых запросов в индексе

Сигналы ранжирования

Google использует несколько компонентов для ранжирования страниц:

— QBST: Определяет важные слова для релевантных страниц

Это система запоминания, которая помогает Google "понимать факты о мире", и она обучается на данных пользователей за примерно 13 месяцев

— Navboost: Запоминает данные о кликах пользователей, чтобы сопоставлять запросы и документы

В настоящее время Navboost обучается на данных за 13 месяцев (раньше, до 2017 года, было 19 месяцев).

Но тринадцать месяцев пользовательских данных, полученных Google, эквивалентны более чем 17 годам данных в Bing 🤯

Системы обобщения

— RankBrain, DeepRank, RankEmbed, RankBERT и MUM — Меньше зависят от пользовательских данных, лучше понимают язык — Позволяют Google обобщать и заполнять пробелы, где не хватает пользовательских данных

Более старые сигналы используют до 1 триллиона примеров, тогда как новые алгоритмы требуют только 1 миллиард.

Большие языковые модели (LLM)

— Недавние дополнения (после 2021 года): LaMDA, PaLM и PaLM2 — Не обучаются на пользовательских данных — Они дополняют, а не заменяют старые системы

Navboost, QBST и системы обобщения все еще активны.

Navboost остается одним из сильнейших сигналов ранжирования Google.

Несмотря на то, что он считается "традиционным" сигналом ранжирования, Navboost может превзойти LLM и системы обобщения в таких аспектах, как свежесть 🌱

#seo #сотрудничество #бизнес #продвижение #маркетинг #tenchat #нейросети #тенчат #сайт

Как работает Google? 🔎 | Сетка — социальная сеть от hh.ru