«Статзначимо» в A/B не значит «можно катить». Вердикт — это не p-value, а решение под риск.

Узнаваемый сценарий: эксперимент зелёный, график красивый, дедлайн горит — и фича уезжает в прод. Через месяц выясняется, что эффект микроскопический, поддержка дорогая, в одном важном сегменте стало хуже, а данные в тесте были с дырой. Самое обидное: формально аналитика была «правильной», но решение — нет.

Почему так происходит: A/B отвечает на узкий вопрос «есть ли основание думать, что эффект не ноль при текущих допущениях». Продуктовый вопрос другой: «стоит ли нам обменять деньги, время команды и риски на этот эффект». Между ними пропасть, и её нужно закрывать явным фреймворком.

Минимальный стандарт финального вердикта из 5 пунктов:

  1. Размер эффекта и доверительный интервал Смотрите не на звёздочки, а на диапазон. Если нижняя граница — это «почти ничего», вы покупаете неопределённость. Сразу фиксируйте минимально полезный эффект и сравнивайте с ним, а не с нулём.

  2. Риски побочек Любая фича меняет не одну метрику. Минимум: guardrails (отток, ошибки, скорость, маржа, саппорт) и правило, что делаем при конфликте метрик. Если guardrails не определены заранее — красный флаг.

  3. Устойчивость по сегментам Не «всё ок в среднем», а «не сломали ключевые группы». Проверьте хотя бы: новые/старые, платящие/неплатящие, разные платформы, гео, каналы. И договоритесь, какие сегменты имеют право вето.

  4. Качество данных Экспозиция, рандомизация, дубли, пропуски, задержки событий, изменения трекинга во время теста. Если вы не можете уверенно сказать «кто попал в тест и почему» — лучше не делать выводов, даже если статистика красивая.

  5. Стоимость внедрения и поддержки Эффект может быть реальным и всё равно не окупаться: разработка, сопровождение, техдолг, нагрузка на саппорт, риск будущих регрессий, усложнение логики. «Катить» — это обязательство, а не награда.

В правильной практике финал выглядит как короткий decision memo: что меняем, на какую метрику давим, какой диапазон эффекта считаем приемлемым, какие guardrails обязаны выжить, какие сегменты критичны, что с данными, сколько стоит владение. Обычно спорят не про статистику, а про то, какой риск бизнес готов принять. Исключение простое: если это исследовательский тест без прод-обязательств — тогда можно осознанно играть в «статзначимо», но честно пометить результат как гипотезу, а не как решение.