Предельно душно про а/б тесты

ошибки в А/Б-тестах. не самые очевидные из них

перечисленное можно считать ошибками, когда они сделаны неосознанно. если по каким-то причинам хочется сделать именно так и это осознается, отмечается в ограничениях/особенностях/рисках эксперимента – то это ок. эксперименты штука гибкая

типологию ошибок привожу опираясь на свой ~шестилетний опыт проведения а/б в роли продакта. в начале пути с а/б-тестами и сам не все эти ошибки замечал, о существовании каких-то даже не подозревал. возможно и сейчас что-то упускаю из внимания

. . . дизайн эксперимента:

в дизайне эксперимента ошибки сводятся к двум категориям – (1)тестируем не то и (2)тестируем не так. список типов ошибок может продолжаться до бесконечности если рассматривать и более частные случаи

i. оценка эффекта на целевую метрику (например GMV) по метрикам без доказанной причинно-следственной связи с этой самой целевой метрикой

например измеряется только добавление в корзину, без проверки будут ли добавленные товары выкуплены

ii. бизнес задача и эксперимент расходятся = в дизайн эксперимента не заложены необходимые для выводов метрики

например задача внедрить новый способ продажи товаров комплектами, а измеряется только эффективность экрана, где эти комплекты показаны. без оценки влияния на опыт пользователя в целом, где теперь (а)есть выбор покупать комплектом или (б)этого выбора нет

iii. проведения эксперимента на удачу. без моделирования и предположений как и на какие метрики изменения повлияют

«добавим что-то, а там увидим, как поменяются метрики» – приводит к раздуванию количества проводимых тестов. оставляет без знаний о причинно-следственных связях по итогу проведения

единственный плюс – то, что не должно было быть даже реализовано всё-таки не попадёт на прод

ошибки дизайна эксперимента решаются теоретической подготовкой, опытом и насмотренностью, а также через ревью тестов с участием шарящих продактов/аналитиков

распределение по вариантам:

i. неравномерно распределенные выборки. поможет А/А-тест в начале или проведение А/А/B/C-тестов

ii. важные для эксперимента свойства/параметры распределены не случайно (диспропорция в параметрах)

например в группе оказалось 70% женщин, а в другой оказалось 70% мужчин. пример иллюстративный, на практике обычно важно чтобы сегменты пользователей (например b2b/b2c или пользователи с определенным параметром, важным для теста) были распределены равномерно. поможет описание каждой выборки перед оценкой эксперимента

iii. не исключены из анализа те, кто не сталкивался с изменениями в эксперименте

например меняем опыт оформлении заказа, а считаем метрики по всем, даже тем, кто не начинал оформлять заказ

анализ результатов:

i. не правильно подобран статистический критерий

например критерий Т-стьюдента для ненормально распределенной выборки. ненормально обычно распределяются время (продолжительность сессии) или деньги (GMV, ARPPU, AOV)

ii. ошибки в рассчетах. не исключены выбросы и тд.

интерпретация:

i. экстраполяция полученных результатов без оценки их применимости для изменяемых условий внешного мира и настроек системы

пример раз: провели в новогодние праздники, и без оценки сопоставимости аудитории в другие промежутки времени посчитали, что наблюдаемый в эксперименте эффект будет и летом и осенью.

пример два: посчитали как работает отображение скидок в период, когда были большие скидки на товары и не думаем о том, как это будет работать если скидки уменьшаться

. . . вывод по итогам этого и предыдущего поста: мало просто проводить а/б-тесты, нужно ещё и уметь гарантировать их корректность и достоверность

наличие инструмента для а/б-тестов ещё недостаточное условие для того, чтобы их проводить