ML вообще работает? ч3

Начинается мое любимое: как померить ощущение «персональности» рекомендаций?

Про учет пола, возраста и размера все и так в курсе, поэтому поговорим о чем-то более интересном

Чаще всего смотрят смотрят на вау-метрики типа serendipity ~ высокий скор релевантности товара для юзера, но не популярный товар

Но, если честно, я ни разу не видел, чтобы эта метрика кого-то убедила, что лента персональная. Имхо потому что:

  • метрика завязана на скор модели (модель оценивает сама себя)
  • метрика не очень интерпретируема

Поэтому я бы заходил с другой стороны

Учет базовых интересов из истории взаимодействий В широком смысле персонализация — учет истории взаимодействий пользователя с сервисом. Очевидно, но так давайте явно проверять, учитывает ли это наша система!

Я бы мерил в терминах Defect rate долю показанных товаров, для которых есть взаимодействия с

  • Широкими категориями из истории (покупал спальник — рекомендуем ли товары для туризма?)

  • Любимыми брендами (купил футболку muted — показываем ли шорты/носки этого бренда?)

Через такую метрику «у нас 60% рекомендаций из широких категорий юзера и 25% из любимых брендов» вполне можно убеждать бизнес (и себя!), что персонализация работает. Плюс, легко проверить для отдельно взятого юзера, работает ли персонализация конкретно для него

Stay tuned