ANCOVA2 для декомпозиции эффекта A/B теста

Запустил тест на AI-фотки в карточках товаров, метрика прокрасилась в минус, и теперь надо объяснить продакту, какая категория товаров с нейрослопом тянет вниз

Первая мысль тут нарезать юзеров по категориям и запустить t-test в каждой, но damn это же 10 тестов без поправки на множественные сравнения, без контроля за препериодом и без ответа на вопрос “эффект правда разный по категориям или это просто шум в оценках”

Что делать

Есть ANCOVA2 (она же Lin estimator), которая решает всё это одной регрессией. В модель закладывается отдельный эффект treatment для каждой категории плюс препериодный CR как ковариата, которая вычитает шум, существовавший ещё до начала теста (та же идея что в CUPED). Коэффициент при каждой категории показывает, насколько её эффект отклоняется от базовой, а F-test на совместную значимость этих коэффициентов формально подтверждает или опровергает гетерогенность

В своём тг канале выложил ноутбук, в котором разбираем на синтетике по шагам: общий t-test, наивная нарезка и её проблемы, ANCOVA2 с разбором таблицы коэффициентов, F-test на гетерогенность, и в конце раскладываем общий эффект на вклад каждой категории ⬇️