Как «ускорить A/B» и не ускорить самообман: дерево решений по рычагам
Ситуация знакомая: тест «должен был закончиться за неделю», а на второй неделе всё ещё «шумит», график скачет, продакт нервничает, аналитик начинает поджимать MDE или смотреть результаты каждый день. Цена ошибки тут простая: вы либо останавливаете тест на флуктуации, либо держите его слишком долго и теряете скорость продукта.
Механика одна: длительность теста растёт из-за 1) высокой дисперсии метрики, 2) малого эффективного трафика на вариант, 3) дизайна, который «размазывает» эффект (пересечения аудиторий, сезонность, обучение пользователей, зависимость наблюдений).
Дерево решений, если хочется быстрее:
- Сначала проверьте цель: вас устраивает MDE и мощность?
- Если нет, не «ускоряйте», а честно пересоберите ожидания: меньший MDE почти всегда означает дольше или больше трафика. Риск: поджимая MDE задним числом, вы покупаете красивый вывод ценой ложных находок и нереплицируемости.
- Если MDE и мощность ок, следующий рычаг — трафик и аллокация
- Увеличьте долю трафика на эксперимент (или уменьшите число параллельных тестов).
- Уберите аудитории с нулевой чувствительностью, если это заранее определённый срез. Риски: sample ratio mismatch, конфликты экспериментов, «перекос» состава пользователей между группами.
- Если трафик ограничен, уменьшайте дисперсию, а не терпение
- Перейдите на метрику с меньшей шумностью, но с тем же продуктовым смыслом (иногда прокси честнее, чем «главная», если главная редкая).
- Стратификация или CUPED/регрессия на предэкспериментальные признаки, но только на то, что не может быть затронуто тестом. Риски: утечка (когда ковариата уже «заражена» экспериментом), дрейф данных, сложнее объяснить результат без потери доверия.
- Если и это не помогает — меняйте дизайн эксперимента
- Последовательные тесты или заранее заданные «ворота остановки», чтобы не делать вид, что вы не подсматриваете.
- Кластеризация (по пользователю, аккаунту, гео), если есть интерференция. Риски: без жёсткого stopping rule последовательность превращается в легальный p-hacking; кластеризация увеличивает дисперсию и может сделать «быстрее» только на бумаге.
Правильная практика выглядит скучно: перед стартом фиксируете MDE, мощность, правило остановки, аллокацию, список ковариат для стратификации, критерии качества данных и список конфликтующих экспериментов. Обычно спорят не про статистику, а про дисциплину: готовы ли вы жить с заранее выбранными правилами, когда первые графики «так соблазнительно зелёные».
Граница применимости: если метрика редкая или эффект ожидаемо микро, «ускорить» без изменения вопроса нельзя — можно только поменять дизайн или принять, что ответ будет позже.