🤔 Если вы просто подадите сырые данные в модель, результат вас разочарует. Алгоритмы кластеризации крайне чувствительны к распределению данных

Вот несколько важных этапов подготовки данных: 1. Работа с выбросами (Outlier Detection)

Один клиент с аномально огромным чеком может сместить центроиды всей модели

Isolation Forest Отличный алгоритм на базе деревьев решений, который буквально изолирует аномалии. Работает быстрее и точнее, чем простые статистические методы

Local Outlier Factor (LOF) Помогает найти выбросы не только по абсолютному значению, но и по плотности данных вокруг объекта

2. Клиппинг (Clipping / Winsorization) Иногда удалять выбросы жалко (это ведь тоже реальные клиенты). Тогда мы используем клиппинг — ограничиваем значения признаков по определенному перцентилю (например, 1-й и 99-й). Все, что выше 99-го перцентиля, приравнивается к нему. Это сохраняет данные, но убирает их экстремальное влияние на модель

3. Снижение размерности (PCA) Если у вас 50 признаков, модель может запутаться в «проклятии размерности»

Principal Component Analysis (PCA) помогает схлопнуть множество коррелирующих признаков в несколько главных компонент. Это убирает лишний шум и часто делает кластеры более выраженными

4. Масштабирование (StandardScaler) Напоминаю еще раз: алгоритмы считают расстояния. Если вы не нормализуете данные, признак с большими числами (например, доход) полностью подавит признаки с маленькими числами (например, количество сессий на сайте)

Краткий пайплайн: Очистка → Клиппинг/Isolation Forest → Scaling → PCA (если признаков много) → Кластеризация

В следующий раз обсудим, как интерпретировать полученные кластеры ❤️ — если нужен такой пост

🤔 Если вы просто подадите сырые данные в модель, результат вас разочарует. Алгоритмы кластеризации крайне чувствительны к распределению данных
Вот несколько важных этапов подготовки данных:
1 | Сетка — социальная сеть от hh.ru 🤔 Если вы просто подадите сырые данные в модель, результат вас разочарует. Алгоритмы кластеризации крайне чувствительны к распределению данных
Вот несколько важных этапов подготовки данных:
1 | Сетка — социальная сеть от hh.ru