ML вообще работает? (эпизод 1)

Давно не писал в канал. Понял, что сейчас сфокусирован на довольно больших историях, которые в формат одного поста не умещаются - ну что ж, готовьтесь к серии постов:) Заголовок конечно чуть кликбейтный для привлечения внимания

"А персональные ленты товаров вообще работают? А для какого % пользователей - скорее нет?" -- Вот один из вопросов, который донимает меня последнее время. Подобное есть в любом ML-продукте от банковского скоринга до LLM-чатов, но ответить на этот вопрос не так-то просто

На первый взгляд, элементерно: есть бизнес-метрики (продажи, CR и тп) и оффлайн-метрики (ndcg, recall@k). Если они достаточно хороши (vs бейзлайн и vs прод неделю назад), то все круто же? А вот и нет. Эти метрики (как и почти все другие классические в ML и продукте) показывают качество в среднем. В среднем, у нас может быть хороший продукт, но условно для 10% пользователей - плохим. Проблема чаще всего в том, что это важные 10%: новички, пред-отточники, пока еще малоактивные пользователи. Если не сделать для них качественный ML-продукт, то со временем они просто уйдут = долгосрочно это падение всех основных метрик, хотя в моменте может быть и особо не заметно. Ну и бонусом у вас постоянный поток негативного фидбека 😢

Поэтому хорошо бы мерить не только качество в среднем, но и долю плохих кейсов (дефектов) = defect rate. Пусть дефект - случай, когда пользователь сталкивается с чем-то очевидно стремным, что может привести к мгновенному окончании сессии в приложении или даже оттоку

Посмотрите на свои ML-продукты. Особенно если они b2c - на экраны приложений с ними. Как часто вы видите дефекты и какие? Покидайте в комменты скрины с дефектами - может, что-то из них разберу. И поставьте лайк что ли, если эта тема интересна -- у меня там на очереди уже есть несколько эпизодов с деталями, как этот defect rate можно считать)