A/B-тестирование: математика. Как запускать эксперимент

A/B-тест — это не синоним слова «попробовать». Это строгий статистический эксперимент, способный либо подтвердить гипотезу, либо уберечь продукт от дорогого внедрения. Итоговая ценность сплит-теста измеряется не количеством «зелёных» вариантов, а качеством принятых решений. Ниже — проверенная рамка, по которой строятся продактовые и маркетинговые A/B-тесты, перестающие быть лотереей.

1. От гипотезы к дизайну Начинайте не с идеи, а с формулировки: «Если мы [изменим элемент], то [метрика] изменится на [Х]%, потому что [предположение о поведении пользователя]». Гипотеза, лишённая причинно-следственной связи, не даёт инсайтов даже при выигрыше.

2. Один тест — один изолированный фактор. Сравнение полностью переработанного лендинга со старым — это не A/B-тест, а дизайн. Такой подход маскирует истинный эффект: вы не узнаете, что сработало — заголовок, цвет кнопки или структура. Исключение — многофакторные тесты на стабильном трафике, требующие большого объёма выборки.

3. Расчёт размера выборки и длительности Запуск без расчёта MDE и требуемого n — верный способ получить ложнонегативный результат. Жёсткое правило: не останавливать тест до достижения нужного объёма. Досрочная остановка смещает p-value и завышает шанс ложноположительного исхода. Используйте калькуляторы (Evan Miller, Stats Engine от Optimizely) и фиксируйте длительность до старта.

4. Правильные метрики и эффект новизны Primary metric (конверсия, средний чек, ARPU) — компас. Но рядом обязательно ставьте guardrail metrics (например, уровень возвратов, отток). «Выигрыш» кликабельности, убившей retention, — это провал. Учитывайте эффект новизны: часть прироста всегда временна, особенно в интерфейсах. Для чистоты вывода разумно продлить тест на 1–2 полных бизнес-цикла.

5. Статистическая значимость ≠ практическая значимость Результат при α = 0.05 — лишь сигнал о том, что разница вряд ли случайна. Но микроскопический lift в 0,3% при гигантских затратах на внедрение может быть экономически нецелесообразен. Оценивайте доверительный интервал и бизнес-смысл — и только после этого принимайте решение о раскатке.

Что приводит к культуре экспериментов по-настоящему: – Бэклог, приоритезированный по ожидаемому эффекту и простоте. – Прозрачная документация: календарь тестов, сырые данные, пост-анализ с выводами, включая «проигрыши». – Платформенная чистота: один тест на один сегмент, никаких параллельных экспериментов на одной аудитории без перекрёстной изоляции. A/B-тестирование не даёт гарантий гениальных идей. Оно даёт больше — защиту от самоуверенности и основу для поступательного роста продукта. А стабильный выигрыш в 5% на ключевой воронке за месяц — это накопленный результат десятка продуманных экспериментов, а не одного случайного.

Полезно? Буду рад обсудить ваши подходы к построению тестовой культуры и поделиться чек-листом дизайна эксперимента в комментариях.