Если на A/B вы называете метрики “на глаз” — вас утопят уточнениями за 2 минуты.

Сцена знакомая: интервью или синк с продуктом. Вас спрашивают: “Какие метрики выберем для теста?” Вы отвечаете “конверсия, ARPU, retention”. И дальше начинается мясорубка: на каком горизонте, у кого, как считать, что делать с сезонностью, а если вырастет выручка и упадёт качество, а если метрика дергается каждый день. В итоге спор не про эксперимент, а про доверие к вашему мышлению.

Почему так происходит: “метрика” без роли в принятии решения ничего не значит. Пока вы не сказали, что именно доказывает тест, что вы мониторите как побочный эффект, и что является стоп-краном, любая метрика выглядит случайной. Плюс две мины: нечувствительная метрика (вы не увидите эффект) и неинтерпретируемая (вы увидите, но не поймёте что это было).

Минимальный стандарт ответа, который обычно закрывает 80% уточнений:

  1. Назовите primary как решение, а не как число: “Этим тестом я хочу доказать, что меняется X. Primary должна прямо отражать X и быть максимально близко к действию пользователя”.
  2. Добавьте secondary как диагностику: “Если primary сдвинется, secondary покажут, за счёт чего: больше трафика, лучше активация, выше частота, выше чек, меньше отмен”.
  3. Обязательно guardrails: “Это метрики, по которым мы не должны проиграть: ошибки, скорость, возвраты, жалобы, отмены, маржа, качество лидов. Они не про рост, они про безопасность”.
  4. Проверьте чувствительность: “Метрика должна реагировать на изменение в продукте в разумный срок. Если сигнал приходит через месяцы, это не primary для этого теста”.
  5. Проверьте интерпретируемость и устойчивость: “Метрика должна иметь понятную причинную связь с изменением и не ломаться от трекинга, фрода, перекосов выборки и перезапусков событий”.

Короткий скрипт защиты выбора перед продуктом: “Primary выбираю одну, чтобы не было ‘победили по чему угодно’. Secondary держу для понимания механики. Guardrails фиксирую заранее, чтобы рост не купили ухудшением качества. Если хотите поменять метрики после запуска, это уже не измерение, а поиск оправдания”.

Граница применимости простая: если изменение маленькое и локальное, не тяните в primary “бизнес-итог за квартал”. Для таких тестов выигрывает метрика ближе к поведению, а бизнес-эффект выносится в guardrails и последующий мониторинг. Обычно спорят именно про это, и тут как раз видно, кто управляет решением, а кто словами.