Пилот не дал эффекта. Что именно мы узнали?

В развитие мысли, высказанной в одном из предыдущих постов, допустим, что наш пилот закончился без экономии. Отчёт уже собирается автоматически, но сотрудники по-прежнему делали ручную копию и сверяли цифры. Мы измерили время работы с двумя отчётами сразу. Станет ли быстрее без ручного, пока неизвестно.

Что удерживает вторую ветку процесса от удаления? Если она нужна только на время испытания, можно проверить точность нового отчёта, согласовать отказ от старого и повторить замер. Если при сверке находят ошибки, нужно исправить расчёт или учесть время на исправление. А если прежний отчёт требует руководитель, без его решения ручную работу не отменить.

Даже «сверка» может означать разное. Сотрудник находил расхождения в цифрах или всё сходилось, но он всё равно перепроверял отчёт? В первом случае разбираемся с расчётом. Во втором - с тем, зачем оставили контроль: новому отчёту пока нельзя доверять или никто не решился отменить привычную процедуру? Если не задать этот вопрос, можно месяцами исправлять инфосистему, хотя дело не в ней.

Похожая ловушка разбиралась в одном исследовании: вывод зависит от того, кого и какие задачи удалось сравнить. В статье 2025 года от METR, некоммерческой исследовательской организации, изучающей возможности ИИ, 16 опытных разработчиков выполняли 246 реальных задач в знакомых им проектах с открытым исходным кодом. Для каждой задачи случайно определяли, можно ли пользоваться ИИ. С инструментами начала 2025 года работа в среднем заняла на 19% больше времени, хотя разработчики ожидали ускорения.

В следующем аналогичном исследовании уже в 2026 году METR столкнулась с другой трудностью. Часть разработчиков не хотела участвовать: им пришлось бы выполнять некоторые задачи без ИИ. Некоторые участники не предлагали задачи, в которых особенно рассчитывали на помощь ИИ. Эти люди и задачи выпадали из сравнения. Авторы статьи по второму исследованию предполагали, что новые инструменты помогают сильнее, но не считали оценку надёжной.

Первое исследование показало замедление в конкретных условиях. Во втором оказалось трудно измерить эффект. Одно наблюдение не доказывает другое: однократное отсутствие экономии при двух отчётах не отвечает на вопрос, сколько времени займёт работа с одним. Нужно отделять результат пилота от интерпретации: мы не доказали, что автоматизация бесполезна, но и не доказали, что она экономит время после отмены старого шага.

После пилота стоит записать не только «получилось или нет», но и что именно удалось проверить.

Обещанного сокращения времени нет - цель пилота не достигнута. Полезные наблюдения этого не отменяют: словами «мы многому научились» легко оправдать любые затраты. Но если понять причину, можно выбрать, что делать дальше: исправлять инструмент, менять порядок работы или остановиться.

Для этого хватит короткой записи: что хотели изменить, с чем сравнивали новый способ, что получили и чего не проверили. Например: «Время не сократилось: ручную копию пока требует руководитель. Время без неё не измеряли. Уточним, можно ли от неё отказаться; если нет - оценим решение с учётом этой работы».

За общим временем я бы показал и его части: сколько ушло на автоматическую сборку, ручную копию, сверку и разбор расхождений. Тогда видно, какая работа нужна лишь во время испытания, а какая останется после внедрения. Если копию уберут, но ошибки придётся исправлять, это время всё равно войдет в расчёт. Сравнивать нужно сопоставимый объём работы и равное качество результата.

Новый замер имеет смысл, если изменятся условия и станет ясно, на какой вопрос он ответит. Например, точность нового отчёта проверят, а руководитель разрешит отказаться от ручного. Если копию по-прежнему требуют и больше ничего не меняется, повторять пилот ради ещё одной попытки не стоит.

Неудачный пилот не обязан закончиться новой попыткой. Но стоит оставить после него достаточно сведений, чтобы не начинать тот же спор с нуля.

Пилот не дал эффекта. Что именно мы узнали? | Сетка — социальная сеть от hh.ru