A/B почти всем хорош
— А давайте A/B тест? Посадим половину команды на ассистента, половину — без. Нет. В реальной команде так не работает. Знание перетекает мгновенно. Сегодня вы изолировали группу, на следующем дэйли все уже все знают.
Но задачу по оценке влияния AI никто не отменял. Как упоминал ранее — мы решили смотреть на распределение рабочего времени вместо подсчета запросов или токенов. А вместо A/B применили Interrupted Time Series: добровольцы сравнивались не с другой группой, а сами с собой — до и после внедрения ассистента. Главная боль методологии — подбор интервалов. Мы искали два окна, в которые не попало ни одного релиза, реорга или найма. Часть статистики потеряли — в основном из-за больничных.
По итогу: перераспределение рабочих часов было значительным и четко совпало с моментом внедрения. В реальных полевых условиях мы сделали все, что могли. Сказать «повезло» — значило бы проигнорировать очевидное.
🔥 Как показал наш опыт, Interrupted Time Series — рабочий способ оценить эффект без контрольной группы. Хоть и имеет вопросы к точности по сравнению с A/B.