A/B-тест не обязателен. Но если вы не проходите пару проверок, ваши “инсайты” превращаются в красивую историю без доказательств.

Типичная сцена: продукт хочет “быстро проверить фичу”, маркетинг — “оценить кампанию”, коммерция — “поменять цену и понять эффект”. В итоге берут первые попавшиеся данные, сравнивают “до/после” и бегут в релиз. Цена ошибки — решение, которое нельзя откатить: сломанный доход, перекошенные метрики, конфликт команд “данные врут”.

Почему так происходит: почти любое изменение приходит вместе с шумом. Сезонность, акции конкурентов, изменения ассортимента, релизы, перераспределение трафика, ручные вмешательства. Если вы не контролируете, кто получил воздействие и почему, вы меряете смесь эффекта и контекста.

Минимальная логика выбора метода (если/то), чтобы не самообмануться:

  1. Есть реальная рандомизация и вы можете удержать её от протечек (пользователь не прыгает между вариантами, таргетинг не “оптимизируется” по ходу) — делайте A/B. Это базовый стандарт, когда ставка высокая.
  2. Рандомизации нет, но есть чёткая граница включения (порог, дата запуска по регионам, по складам, по платформам) и вы знаете, что именно определяет попадание — берите квази-эксперимент. Ключевое: “правило попадания” должно быть стабильным и объяснимым.
  3. Вы меняете цену или ассортимент одновременно с другими коммерческими вещами — наблюдательные сравнения почти всегда дают ложную уверенность. Нужны либо заранее спланированные ступенчатые выкладки, либо инструментальные прокси, либо честное “оценка верхней границы/коридора”, а не “точный эффект”.
  4. Трафика мало или риск велик (юридический, брендовый, безопасность) — не пытайтесь выжать “значимость” любой ценой. Делайте guardrails, короткие пилоты, измеряйте направленность и побочные эффекты, а эффект подтверждайте позже более сильным дизайном.
  5. Сильная сезонность или тренд (праздники, зарплатные дни, распродажи) — “до/после” без контроля почти бесполезно. Нужна контрольная группа или дизайн, где сезонность вычитается, а не обсуждается на слайде.

В хорошей практике выбор метода начинается не с “что быстрее”, а с “какую уверенность мы обязаны иметь, чтобы это решение было обратимым и безопасным”. Обычно спорят про статистику, но ломается всё раньше — на рандомизации, на стабильности назначения воздействия и на честном описании того, что вы не контролируете. Граница применимости простая: если вам нужна причинность для большого решения, наблюдательные данные — это гипотеза, не вердикт.