🎯 Когда витрина «подмигивает», а ты не знаешь, верить ли ей
Знакомый ритуал: приходит бизнес и говорит: «Давайте посмотрим по сегментам — чтобы было чисто, гомогенно».
Я киваю: звучит по‑взрослому.
А потом включается магия множественных сравнений.
Можно взглянуть на ситуацию через привычную картину: витрину кредитных офферов в приложении. Десяток карточек, каждая будто шепчет: «Выбери меня!». И одна прямо цепляет: «Ставка от 12% + кэшбэк 5% + без справок». На мгновение кажется: вот оно, идеальное предложение.
А в мелком шрифте — страховка, пакет услуг, зарплатный проект.
Пазл сходится: из кучи вариантов один специально собрали так, чтобы выглядеть выигрышно.
В A/B‑тестировании ровно та же механика. Просят «порезать на страты и посмотреть, где выстрелит» — открывается такая же витрина: affluent, массовый сегмент, новые/старые, активные/спящие… Чем больше карточек, тем выше шанс, что хотя бы одна «подмигнёт» статистической значимостью просто потому, что её очень внимательно разглядывали.
При этом за таким запросом нередко стоит вполне понятная бизнес‑логика: важно подтвердить финансовый эффект хотя бы в одной страте — чтобы показать окупаемость усилий, закрыть отчётный период или обосновать продолжение работы над фичей.
Это не про «поймать шум любой ценой», а про попытку найти точку опоры: если где‑то эффект есть, значит, направление в целом не пустое.
Бизнес искренне недоумевает: «В общей выборке эффекта нет, а в affluent есть — значит, масштабируем!»
Но мы-то понимаем: без поправки на множественные сравнения этот «успех» — тот самый оффер со ставкой «от 12%», который хорош ровно до мелкого шрифта.
Формально это рост FWER (family‑wise error rate): при α = 0,05 и 20 независимых тестах шанс поймать хотя бы один ложный «успех» случайно — уже ~64%. То есть больше половины шансов, что сигнал — это просто шум.
И если пытаться подтвердить эффект перебором страт, статистика перестаёт быть инструментом принятия решений — и становится способом подобрать нужный ответ. Как честно застраховать выводы:
✅ Бонферрони — строго и понятно.
Делим порог значимости на число тестов: было 0,05, стало 0,005. Риск ложных срабатываний падает, но и мощность теста тоже: реальный эффект может не пройти планку. Особенно чувствительно, когда выборки по сегментам и так невелики.
✅ Метод Холма — мягче, но всё ещё про контроль FWER.
Собираем все p‑значения, сортируем от меньшего к большему и идем по списку с поправкой по позиции. Как только встречают первое «незначимое» — дальше ничего не считаем значимым. Мощность выше, чем у Бонферрони, а защита от случайных находок остаётся.
✅ FDR — когда важнее не пропустить сигналы.
Контролируем долю ложных открытий среди всех «значимых» результатов. Например, допускаем, что не более 5% из найденных эффектов — случайные. Подходит для исследовательских задач: «Вот интересные сегменты — собираем больше данных и проверяем ещё раз».
Самый честный ответ бизнесу: если в общей выборке эффекта нет, а в стратах он появляется только после множества проверок — это не сигнал к масштабированию. Это сигнал либо собрать больше данных, либо пересмотреть гипотезу.
И бизнес тут не злодей: он хочет ясности и чтобы усилия не были зря. Задача команды — не спорить, а показать, где прячется случайность и как страхуют выводы, чтобы не ошибиться вместе.
Так что, если снова скажут «посмотрите по сегментам», можно спокойно кивнуть и добавить: «Да, посмотрим. Только сразу с поправкой — чтобы не праздновать победу над мелким шрифтом».