Всем привет!
В предыдущем посте я рассказывал про разные типы переменных в Causal Inference. И, как и обещал, начинаю рассказ о том, как правильно выбирать переменные при использовании мэтчинга.
И в этом посте для начала разберем методы, которые не работают
1. Взять все метрики на пре-периоде. Этот метод первым приходит в голову Однако здесь возникает проблема, связанная с тем, что, как мы выяснили в предыдущем посте, помимо конфаундеров есть еще медиаторы и коллайдеры. И если логика «брать только метрики на пре-периоде» поможет избавить нас от опасности взять медиаторы, то риск взять коллайдер всё равно остается.
2. Переменные с наибольшим SHAP значением или коэффициентом линейной регрессии. Это довольно распространенный метод. Однако, используя его, мы отберем переменные, которые имеют хорошую предикативную силу в предсказании целевой переменной. Но наша задача — не сделать как можно более точный прогноз, а взять в модель конфаундеры, тем самым убрав смещение.
3. Итерационное добавление переменных в линейную регрессию. Логика этого подхода заключается в том, что в модель линейной регрессии итеративно добавляются переменные со статистически значимым коэффициентом. Тут явным образом возникает проблема множественного сравнения, а также зависимость всего результата от того, не совершили ли мы ложный «прокрас» на предыдущем этапе. Плюс возникает проблема с мощностью: на финальном шаге необходимо прогнать модель со всеми включенными переменными, но уже на другой подвыборке.