A/B-тест: «значимо» не значит «полезно для бизнеса»

Самая частая ловушка в экспериментах выглядит так: получили p-value меньше порога, написали “победа”, выкатили. Через месяц North Star не сдвинулся, юнит-экономика просела, команда в споре “статистика нас подвела”. Нет, подвёл отчёт и правила принятия решения.

Почему так происходит: статистическая значимость отвечает на вопрос “похоже ли, что эффект не ноль”. Но бизнес живёт в другом измерении: “достаточно ли эффект большой, чтобы окупить изменения, риски и альтернативные задачи”. Микроскопический сдвиг может быть значимым на большой выборке и одновременно бессмысленным в P&L. А ещё “выигрыш” по локальной метрике легко покупается ухудшением downstream: возвраты, отмены, маржа, саппорт, удержание.

Минимальный стандарт для отчёта по эксперименту (и это же поля, которые стоит добавить в шаблон):

  1. Иерархия метрик: Primary (для решения), Guardrails (что нельзя ухудшать), Diagnostic (для объяснения). Без этого вы всегда найдёте “победителя” постфактум.

  2. Практический порог эффекта до запуска: минимально полезное изменение для Primary и допустимые просадки по guardrails. Не “хочу роста”, а “меньше этого — не трогаем”.

  3. Интервал эффекта, а не одна цифра: показывайте диапазон и сценарии “лучший/ожидаемый/плохой”. Решение принимают по худшему приемлемому сценарию, а не по красивому среднему.

  4. Перевод в бизнес-импакт: как эффект на Primary проходит до North Star и юнит-экономики. В отчёте должна быть строка “механика + формула влияния”, даже если расчёт грубый: где появится выручка/экономия и где могут вылезти затраты.

  5. Качество и валидность: SRM, стабильность трекинга, изменения в составе трафика, инвариантные метрики, логические проверки. Если тут красные флаги — “значимость” не спасает.

В хорошей практике финальный вывод выглядит не как “значимо, катим”, а как короткий decision memo: “эффект достаточно большой относительно порога, guardrails не просели, ожидаемый вклад в North Star/юнит-экономику положительный, риски понятны, план раскатки и мониторинга задан”. Обычно спорят про пороги и перевод в деньги — и это нормальный спор: он про бизнес, а не про p-value. Исключение одно: исследовательские тесты, где цель — обучение, тогда честно помечайте решение как “инсайт”, а не “победа”.