«Статзначимо» в A/B не равно «можно катить». Если ваш вердикт заканчивается на p-value, это красный флаг.
Типичный сценарий: тест “победил”, все уже пишут релиз-ноты, а через неделю начинаются откаты, объяснительные и спор “аналитика подвела”. На деле подвёл не тест, а решение: вы проверили факт отличия, но не проверили, что это полезно, безопасно и воспроизводимо.
Почему так происходит: статзначимость отвечает на вопрос “похоже ли, что эффекта нет”, но почти не помогает с вопросами “насколько большой эффект”, “какой риск минуса”, “где это сломается” и “во что это обойдётся”. А именно это и есть продуктовое решение.
Минимальный фреймворк финального вердикта после A/B:
-
Размер эффекта и доверительный интервал. Смотрите не на “прошли порог”, а на диапазон: что в худшем и лучшем случае. Если нижняя граница около нуля или минус — это не победа, это лотерея. Если эффект меньше порога, при котором он имеет смысл для бизнеса, катить нечего, даже если “значимо”.
-
Риски побочек. Обязательны guardrails: удержание, возвраты, ошибки, latency, отмены, маржинальность — что реально может пострадать. Побочка, которая статистически не доказана, всё равно риск, если интервал допускает неприятный минус.
-
Устойчивость по сегментам. Не “порыться и найти где красиво”, а заранее определить ключевые срезы: новые/старые, платящие/неплатящие, платформы, гео. Если эффект держится только на одном сегменте и вы не понимаете механики — общий rollout опасен.
-
Качество данных. Любой победитель превращается в мусор, если есть рассинхрон экспозиции, дубли событий, разный лаг трекинга, поломанный assignment, промо-трафик, изменения в логике событий во время теста. Проверки должны быть рутиной, а не “когда что-то подозрительно”.
-
Стоимость внедрения и поддержки. “Катим” — это не кнопка. Это технический долг, мониторинг, поддержка, влияние на скорость команды и на будущие эксперименты. Маленький выигрыш, который требует постоянных костылей, часто хуже честного нуля.
Правильная практика выглядит так: финальный документ — это не график с p-value, а решение с рисками и планом контроля после выката. Обычно спорят про сегменты и “побочки незначимы” — но продукт живёт не в значимости, а в худшем правдоподобном сценарии. Исключение: локальные изменения с минимальным blast radius, где откат дешёвый и последствия ограничены.