🎯 Когда витрина «подмигивает», а ты не знаешь, верить ли ей

Знакомый ритуал: приходит бизнес и говорит: «Давайте посмотрим по сегментам — чтобы было чисто, гомогенно».

Я киваю: звучит по‑взрослому.

А потом включается магия множественных сравнений.

Можно взглянуть на ситуацию через привычную картину: витрину кредитных офферов в приложении. Десяток карточек, каждая будто шепчет: «Выбери меня!». И одна прямо цепляет: «Ставка от 12% + кэшбэк 5% + без справок». На мгновение кажется: вот оно, идеальное предложение.

А в мелком шрифте — страховка, пакет услуг, зарплатный проект.

Пазл сходится: из кучи вариантов один специально собрали так, чтобы выглядеть выигрышно.

В A/B‑тестировании ровно та же механика. Просят «порезать на страты и посмотреть, где выстрелит» — открывается такая же витрина: affluent, массовый сегмент, новые/старые, активные/спящие… Чем больше карточек, тем выше шанс, что хотя бы одна «подмигнёт» статистической значимостью просто потому, что её очень внимательно разглядывали.

При этом за таким запросом нередко стоит вполне понятная бизнес‑логика: важно подтвердить финансовый эффект хотя бы в одной страте — чтобы показать окупаемость усилий, закрыть отчётный период или обосновать продолжение работы над фичей.

Это не про «поймать шум любой ценой», а про попытку найти точку опоры: если где‑то эффект есть, значит, направление в целом не пустое.

Бизнес искренне недоумевает: «В общей выборке эффекта нет, а в affluent есть — значит, масштабируем!»

Но мы-то понимаем: без поправки на множественные сравнения этот «успех» — тот самый оффер со ставкой «от 12%», который хорош ровно до мелкого шрифта.

Формально это рост FWER (family‑wise error rate): при α = 0,05 и 20 независимых тестах шанс поймать хотя бы один ложный «успех» случайно — уже ~64%. То есть больше половины шансов, что сигнал — это просто шум.

И если пытаться подтвердить эффект перебором страт, статистика перестаёт быть инструментом принятия решений — и становится способом подобрать нужный ответ. Как честно застраховать выводы:

✅ Бонферрони — строго и понятно.

Делим порог значимости на число тестов: было 0,05, стало 0,005. Риск ложных срабатываний падает, но и мощность теста тоже: реальный эффект может не пройти планку. Особенно чувствительно, когда выборки по сегментам и так невелики.

✅ Метод Холма — мягче, но всё ещё про контроль FWER.

Собираем все p‑значения, сортируем от меньшего к большему и идем по списку с поправкой по позиции. Как только встречают первое «незначимое» — дальше ничего не считаем значимым. Мощность выше, чем у Бонферрони, а защита от случайных находок остаётся.

✅ FDR — когда важнее не пропустить сигналы.

Контролируем долю ложных открытий среди всех «значимых» результатов. Например, допускаем, что не более 5% из найденных эффектов — случайные. Подходит для исследовательских задач: «Вот интересные сегменты — собираем больше данных и проверяем ещё раз».

Самый честный ответ бизнесу: если в общей выборке эффекта нет, а в стратах он появляется только после множества проверок — это не сигнал к масштабированию. Это сигнал либо собрать больше данных, либо пересмотреть гипотезу.

И бизнес тут не злодей: он хочет ясности и чтобы усилия не были зря. Задача команды — не спорить, а показать, где прячется случайность и как страхуют выводы, чтобы не ошибиться вместе.

Так что, если снова скажут «посмотрите по сегментам», можно спокойно кивнуть и добавить: «Да, посмотрим. Только сразу с поправкой — чтобы не праздновать победу над мелким шрифтом».

#dswork

🎯 Когда витрина «подмигивает», а ты не знаешь, верить ли ей
Знакомый ритуал: приходит бизнес и говорит: «Давайте посмотрим по сегментам — чтобы было чисто, гомогенно».
Я киваю: звучит по‑взрослому | Сетка — социальная сеть от hh.ru