Подглядывание в A/B каждый день раздувает ложноположительные, даже если вы «ничего не меняете».
Узнаваемо: эксперимент запустили, на второй день метрика “почти значима”, на третий откатилась, на пятый снова “в плюс”. И где-то в этот момент тест либо срочно выкатывают, либо тихо закрывают как “не взлетело”. Цена — решения на шуме: фичи едут в прод без эффекта, хорошие идеи режут, доверие к экспериментам падает.
Механика простая. Каждый новый просмотр результата — это новая попытка найти “сигнал”. Даже если вы не трогаете аудитории и код, вы увеличиваете шанс случайно увидеть “значимость”. Остановка “когда стало красиво” делает p-значение оптимистичным, а уверенность в выводе — фальшивой. Это не проблема людей, это проблема процесса: вы используете одноразовый инструмент как многократный.
Минимальный стандарт, чтобы не самообманываться:
- План остановки до старта. Когда и сколько раз вы имеете право смотреть на основную метрику, и по каким условиям останавливаетесь: win, lose, continue. Без этого любой “мы просто мониторили” превращается в выбор момента.
- Последовательные границы вместо “обычного” порога. Либо фиксируете один финальный анализ, либо используете групповой последовательный дизайн с распределением альфы по просмотрам. Тогда ранние “плюсы” должны быть существенно убедительнее, чем финальные.
- Правила алертов. Алерты должны срабатывать на нарушение границ или на поломку данных, а не на очередное колебание метрики. Иначе алерт становится триггером для преждевременной остановки.
- Лог изменений. Любое вмешательство во время теста фиксируется: правки трекинга, фильтров, исключения трафика, смена определения метрики, багфиксы, перезапуск. Без лога вы не отличите эффект от артефакта.
- Разделяйте мониторинг и решение. Мониторить можно скорость набора, распределение трафика, базовые sanity-чеки. Решение принимается только в запланированных точках и только по заранее указанной основной метрике.
В правильной практике “смотреть” можно хоть ежедневно, но это не означает “решать” ежедневно. Решение привязано к плану остановки, алертам и журналу изменений — тогда эксперимент перестаёт быть гаданием по графику. Исключение одно: проверка на явную поломку данных, где цель не найти эффект, а остановить некорректный сбор.