Меры разброса данных: почему среднее врет
Когда только начинаешь работать с данными, первое что делаешь - считаешь среднее. Средняя зарплата, средний чек, средний возраст пользователей. Кажется, что этого достаточно для понимания картины.
Но среднее часто врет.
Представьте две компании. В обеих средняя зарплата 100 000 рублей. В первой все получают от 90 до 110 тысяч. Во второй - половина по 50 тысяч, а половина по 150. Среднее одинаковое, но ситуации совершенно разные.
Чтобы понять реальную картину, нужно смотреть не только на среднее, но и на разброс данных. Для этого существуют меры разброса.
Что такое меры разброса?
Это показатели, которые говорят насколько сильно данные отличаются друг от друга. Насколько они "разбросаны" относительно среднего значения.
Основные меры разброса: дисперсия, стандартное отклонение, коэффициент вариации. Пройдемся по каждой из них
Дисперсия
Дисперсия**показывает среднее квадратичное отклонение от среднего значения. Формула: Дисперсия = Сумма((X - Среднее)^2) / N
Логика простая: берем каждое значение, вычитаем среднее, возводим в квадрат (чтобы избавиться от отрицательных чисел), суммируем и делим на количество наблюдений.
Пример: Зарплаты в первой компании: 90, 95, 100, 105, 110 тысяч. Среднее = 100. Дисперсия = ((90-100)^2 + (95-100)^2 + ... + (110-100)^2) / 5 = 50
Зарплаты во второй компании: 50, 50, 50, 150, 150 тысяч. Среднее = 100. Дисперсия = ((50-100)^2 + ... + (150-100)^2) / 5 = 2500
Чем больше дисперсия - тем сильнее разброс данных.
Проблема дисперсии - в квадратах исходных единиц. Если измеряем зарплату в рублях, дисперсия будет в рублях в квадрате. Поэтому обычно используют стандартное отклонение. Стандартное отклонение = Квадратный корень(Дисперсия)
Так, мы можем увидеть, что в первой компании зарплаты отклоняются от среднего в среднем на 7 тысяч (корень из 50), а во второй - на 50 тысяч (корень из 2500).
В большинстве случаев при работе со стандартным отклонением руководствуются правилом двух и трех сигм: в нормальном распределении 95% значений лежат в пределах двух стандартных отклонений от среднего, а 99% значений лежат в пределах трех стандартных отклонений от среднего. Это помогает находить и отфильтровывать выбросы.
Однако у стандартного отклонения есть проблема - его сложно сравнивать между разными показателями.
Допустим, стандартное отклонение зарплаты = 50 000 рублей, а стандартное отклонение возраста = 5 лет. Что больше?
Коэффициент вариации решает эту проблему. Он показывает относительный разброс в процентах.
Коэффициент вариации = (Стандартное отклонение / Среднее) х 100%
Теперь можно сравнивать разные показатели. Например:
- Зарплата: среднее 100к, стандартное отклонение 50к, CV = 50%
- Возраст: среднее 30 лет, стандартное отклонение 5 лет, CV = 17%
Коэффициент вариации показывает, что зарплата варьируется сильнее, чем возраст.
Для интепритации разброса обычно руководствуются правилами:
- CV < 10% - слабый разброс, данные однородны
- CV 10-20% - средний разброс
- CV > 20% - сильный разброс, данные неоднородны
Когда это важно в аналитике? 1. Оценка сегментов пользователей У вас два сегмента с одинаковым средним чеком 5000 рублей. Но в первом стандартное отклонение 500 рублей, во втором - 3000. Первый сегмент предсказуем, второй - нет.
2. Выбор метрик для экспериментов Метрика с высоким разбросом требует большую выборку для A/B теста. Если стандартное отклонение конверсии большое - нужно больше пользователей для детекции эффекта.
3. Поиск аномалий Значение, которое отличается от среднего больше чем на 3 стандартных отклонения - скорее всего выброс или ошибка в данных.
4. Сравнение показателей Коэффициент вариации позволяет понять, какие показатели более стабильны. Например, количество заказов может быть более стабильным показателем, чем выручка.
Ставьте 📝 если, узнали что-то новое или 😎, если уже это знали