Diff-in-diff и синтетический контроль ломаются одинаково: если релиз раскатывали не на всех, а вы “просто сравнили до/после”.
Типичная картина: часть регионов или сегментов получила фичу, часть нет. Через неделю график “улетел”, и хочется назвать это эффектом. Цена ошибки — вы начинаете масштабировать, резать бюджеты или защищать релиз на основе движения, которое вообще не связано с продуктом: сезонность, маркетинг, смена состава пользователей, параллельные инициативы.
Механика простая. Diff-in-diff держится на параллельных трендах: без релиза у групп была бы одинаковая динамика. Синтетический контроль держится на том, что вы можете собрать “двойника” из донор-пула, который очень точно повторяет траекторию до релиза. Оба метода умирают, когда “контроль” не является хорошей контрфактической реальностью.
Минимальный стандарт выбора и проверки, если раскатка не на всех:
- Если у вас много единиц наблюдения (регионы, магазины, команды) и понятная схема включения, чаще начинает с diff-in-diff. Если treated единиц мало (иногда одна) и есть хороший донор-пул, чаще выигрывает синтетический контроль.
- Для diff-in-diff сначала смотрите не p-value, а тренды до релиза. Разъезжаются до даты включения — это не “чуть шум”, это красный флаг: оценка, скорее всего, ловит различия групп, а не эффект.
- Для синтетики требование жестче: качество подгонки до релиза должно быть высоким и устойчивым. Если “двойник” плохо повторяет pre-период, после релиза вы просто экстраполируете ошибку.
- Проверьте вмешательства и переливы: параллельные кампании, изменения цен, правила трафика, миграции, cross-exposure. Если контроль мог косвенно пострадать или выиграть от релиза, оба подхода будут систематически врать.
- Следите за составом аудитории и измерениями: смена источников трафика, логин-миграции, пересборка событий, новые фильтры ботов. Если меняется то, кого и как вы считаете, “эффект” легко получается из data quality.
В правильной практике это выглядит так: сначала вы доказываете, что контроль действительно может быть контрфактом (pre-тренды, плацебо-проверки, устойчивость к исключению отдельных доноров), и только потом считаете эффект. Граница применимости простая: если нет нормального pre-периода или релиз шел волнами по правилам, связанным с метрикой, не спасает ни diff-in-diff, ни синтетика — придется менять дизайн, метрику или единицу анализа. Обычно спорят не про формулу, а про то, можно ли вообще доверять контролю.