🤔 Если вы просто подадите сырые данные в модель, результат вас разочарует. Алгоритмы кластеризации крайне чувствительны к распределению данных
Вот несколько важных этапов подготовки данных: 1. Работа с выбросами (Outlier Detection)
Один клиент с аномально огромным чеком может сместить центроиды всей модели
Isolation Forest Отличный алгоритм на базе деревьев решений, который буквально изолирует аномалии. Работает быстрее и точнее, чем простые статистические методы
Local Outlier Factor (LOF) Помогает найти выбросы не только по абсолютному значению, но и по плотности данных вокруг объекта
2. Клиппинг (Clipping / Winsorization) Иногда удалять выбросы жалко (это ведь тоже реальные клиенты). Тогда мы используем клиппинг — ограничиваем значения признаков по определенному перцентилю (например, 1-й и 99-й). Все, что выше 99-го перцентиля, приравнивается к нему. Это сохраняет данные, но убирает их экстремальное влияние на модель
3. Снижение размерности (PCA) Если у вас 50 признаков, модель может запутаться в «проклятии размерности»
Principal Component Analysis (PCA) помогает схлопнуть множество коррелирующих признаков в несколько главных компонент. Это убирает лишний шум и часто делает кластеры более выраженными
4. Масштабирование (StandardScaler) Напоминаю еще раз: алгоритмы считают расстояния. Если вы не нормализуете данные, признак с большими числами (например, доход) полностью подавит признаки с маленькими числами (например, количество сессий на сайте)
Краткий пайплайн: Очистка → Клиппинг/Isolation Forest → Scaling → PCA (если признаков много) → Кластеризация
В следующий раз обсудим, как интерпретировать полученные кластеры ❤️ — если нужен такой пост
· 21.05
Можно каждому атрибуту в таблице написать комментарий: Готовься! Скоро мигрировать будем.
База сама разберётся, как подготовиться)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён