🕵️♂️ Как объяснить своему продакту, что нельзя подглядывать в A/B-тесты до их завершения? Ошибка подглядывания - это когда мы принимаем решение до того, как набралась нужная нам выборка. В чем реальная проблема? Если мы договорились смотреть результат на 10 000 пользователях, наш риск ошибиться 5% (как и планировалось)
Но если мы заходим в стат-калькулятор на 1000, 2000, 5000 юзерах и каждый раз думаем «о, значимо, выкатываем», т.е стопаем тест на первом же «зеленом» p-value, ошибка взлетает до 50%. В половине случаев мы будем внедрять фичи, которые на самом деле ничего не меняют или вообще делают хуже. Смысл А/Б тестирования в таком случае просто пропадает.
Что же отвечать продакту, если он ну уж очень хочет подсмотреть? 🔸P-value - это не линейный график, он постоянно колеблется. 🔸Первые данные всегда самые шумные. Нужно время, чтобы среднее значение стабилизировалось. 🔸Если мы катим фичу на основе «подглядывания», мы с вероятностью 50% внедряем мусор, на который потратили ресурсы.