Красный флаг A/B: вы смотрите метрику каждый день и останавливаете тест “когда стало красиво”
Сценарий знакомый: запустили эксперимент, на третий день конверсия в варианте B выше, чат уже празднует, менеджер просит “фиксировать победу”. Через неделю в проде эффект исчезает, а в ретро звучит “ну оно же было значимо”. Больно не тем, что ошиблись. Больно тем, что вы теперь не знаете, каким выводам в вашей системе вообще можно верить.
Почему это ломает выводы: классический p-value и доверительные интервалы предполагают, что вы принимаете решение один раз, в заранее выбранный момент. Когда вы подглядываете каждый день и готовы остановиться при первом “плюсе”, вы многократно даёте себе шанс поймать случайный всплеск. На графике это выглядит как “поймали удачный день”, в статистике это называется optional stopping, а в бизнесе превращается в ложные победы и качели при повторных запусках.
Минимальный безопасный протокол, если не хотите самообмана:
- До запуска зафиксируйте правило остановки: дата/длительность и целевой размер выборки, плюс что именно является решающей метрикой. Не “посмотрим по ситуации”.
- Разделите мониторинг и решение. Ежедневно можно смотреть только на здоровье теста: SRM, просадки трафика, логирование событий, дубли, задержки, сломанные воронки, guardrails. Решающий эффект не трогаете до стопа.
- Если нужен шанс остановить раньше, используйте метод, который это позволяет: последовательные тесты с корректировкой (alpha-spending, group sequential) или always-valid подходы. Без этого ранняя остановка = лотерея.
- Не меняйте цель на ходу. “А давайте вместо покупки посмотрим клики” после пары дней просмотра — это ещё один способ случайно найти “успех”.
- Ведите журнал решений: когда начали, что мониторили, почему остановили, были ли инциденты с данными. Потом это спасает от переписывания истории.
В правильной практике эксперимент живёт как маленький контракт: заранее понятны сроки, критерии успеха и условия аварийного отката. Единственное честное исключение из “не останавливаем раньше” — безопасность: если guardrail явно ухудшается или продукт ломается, откатываем без попытки “дожать значимость”. Обычно спорят не про статистику, а про дисциплину. И именно она делает результаты пригодными для решений.