Красный флаг A/B: вы смотрите метрику каждый день и останавливаете тест “когда стало красиво”

Сценарий знакомый: запустили эксперимент, на третий день конверсия в варианте B выше, чат уже празднует, менеджер просит “фиксировать победу”. Через неделю в проде эффект исчезает, а в ретро звучит “ну оно же было значимо”. Больно не тем, что ошиблись. Больно тем, что вы теперь не знаете, каким выводам в вашей системе вообще можно верить.

Почему это ломает выводы: классический p-value и доверительные интервалы предполагают, что вы принимаете решение один раз, в заранее выбранный момент. Когда вы подглядываете каждый день и готовы остановиться при первом “плюсе”, вы многократно даёте себе шанс поймать случайный всплеск. На графике это выглядит как “поймали удачный день”, в статистике это называется optional stopping, а в бизнесе превращается в ложные победы и качели при повторных запусках.

Минимальный безопасный протокол, если не хотите самообмана:

  1. До запуска зафиксируйте правило остановки: дата/длительность и целевой размер выборки, плюс что именно является решающей метрикой. Не “посмотрим по ситуации”.
  2. Разделите мониторинг и решение. Ежедневно можно смотреть только на здоровье теста: SRM, просадки трафика, логирование событий, дубли, задержки, сломанные воронки, guardrails. Решающий эффект не трогаете до стопа.
  3. Если нужен шанс остановить раньше, используйте метод, который это позволяет: последовательные тесты с корректировкой (alpha-spending, group sequential) или always-valid подходы. Без этого ранняя остановка = лотерея.
  4. Не меняйте цель на ходу. “А давайте вместо покупки посмотрим клики” после пары дней просмотра — это ещё один способ случайно найти “успех”.
  5. Ведите журнал решений: когда начали, что мониторили, почему остановили, были ли инциденты с данными. Потом это спасает от переписывания истории.

В правильной практике эксперимент живёт как маленький контракт: заранее понятны сроки, критерии успеха и условия аварийного отката. Единственное честное исключение из “не останавливаем раньше” — безопасность: если guardrail явно ухудшается или продукт ломается, откатываем без попытки “дожать значимость”. Обычно спорят не про статистику, а про дисциплину. И именно она делает результаты пригодными для решений.