Если у вас “A/B невозможен”, но вы всё равно обещаете точный causal uplift — красный флаг.

Обычная ситуация: фича раскатилась на регион, канал или весь продукт сразу; отключить нельзя; бизнес ждёт ответ “сработало или нет”. И аналитик начинает подбирать “похожую группу” и называть это экспериментом. Цена ошибки здесь не в красивом графике, а в решениях: закрепили плохое, откатили хорошее, выстроили план по миражу.

Почему ломается причинность без рандома: контрфакт не наблюдаем, а “контроль” почти всегда заражён тем же временем. Сезонность, параллельные релизы, смена микса пользователей, переобучение маркетинга, эффект ожидания, перетекания между сегментами. В квазиэкспериментах это обычно маскируется словами “учли факторы”, в синтетическом контроле — красивым pre-fit, который внезапно рушится сразу после даты вмешательства.

Шпаргалка выбора: квазиэксперимент vs синтетический контроль

  1. Много объектов воздействия и чёткая дата вмешательства, метрика стабильна, есть шанс на параллельные тренды — чаще квази (DiD/ITS). Если тренды расходились до вмешательства, вы уже не в causal, а в сторителлинге.
  2. Один “объект” воздействия (регион, рынок, продуктовая линия) и есть пул доноров + длинный допериод — чаще синтетический контроль. Он хорош, когда контроль нужен “сконструированный”, а не найденный.
  3. Если есть сильные перетекания (спилловеры) между тестом и контролем — оба подхода горят, просто по-разному. Тогда либо меняйте единицу анализа, либо честно снижайте уровень утверждений.
  4. Если вмешательство совпало с другими изменениями, которые по-разному задели группы, идентификация ломается везде. В этот момент “сложнее модель” не лечит.

Как проверять качество контрфакта (минимальный стандарт)

  • Предпериод: совпадение тренда важнее совпадения уровней. Для синтетики требуйте сильный pre-fit на той же частоте данных, что и эффект.
  • Плейсебо: сдвигайте дату вмешательства и “лечите” другие единицы. Если эффекты появляются где угодно, вы меряете шум/время, а не вмешательство.
  • Чувствительность: уберите ключевых доноров (leave-one-out), меняйте окно допериода, пересобирайте пул. Эффект не должен жить на одной хрупкой конфигурации.
  • Негативные контрольные метрики: то, что не должно меняться от вмешательства. Если меняется — вероятен общий шок или артефакт данных.

Артефакты, которые обязаны быть в отчёте: схема дизайна (кто/когда/что считается treated), допущения и где они могут нарушаться, графики трендов и pre-fit, набор доноров/правила исключений, плейсебо и чувствительность, список параллельных изменений в продукте/маркетинге, короткое “что именно можно утверждать” (про этот период, эту популяцию, эту метрику).

Правильная практика выглядит скучно: меньше “мы доказали”, больше “вот контрфакт, вот проверки, вот границы”. Обычно спорят не про метод, а про честность допущений и качество данных. Если допериод короткий или мир вокруг в это время менялся быстрее метрики — лучше не продавать это как causal вообще.