ML вообще работает? ч3
Начинается мое любимое: как померить ощущение «персональности» рекомендаций?
Про учет пола, возраста и размера все и так в курсе, поэтому поговорим о чем-то более интересном
Чаще всего смотрят смотрят на вау-метрики типа serendipity ~ высокий скор релевантности товара для юзера, но не популярный товар
Но, если честно, я ни разу не видел, чтобы эта метрика кого-то убедила, что лента персональная. Имхо потому что:
- метрика завязана на скор модели (модель оценивает сама себя)
- метрика не очень интерпретируема
Поэтому я бы заходил с другой стороны
Учет базовых интересов из истории взаимодействий В широком смысле персонализация — учет истории взаимодействий пользователя с сервисом. Очевидно, но так давайте явно проверять, учитывает ли это наша система!
Я бы мерил в терминах Defect rate долю показанных товаров, для которых есть взаимодействия с
-
Широкими категориями из истории (покупал спальник — рекомендуем ли товары для туризма?)
-
Любимыми брендами (купил футболку muted — показываем ли шорты/носки этого бренда?)
Через такую метрику «у нас 60% рекомендаций из широких категорий юзера и 25% из любимых брендов» вполне можно убеждать бизнес (и себя!), что персонализация работает. Плюс, легко проверить для отдельно взятого юзера, работает ли персонализация конкретно для него
Stay tuned