Одна метрика прячет другую

В эксперименте с участием 758 консультантов одной из крупных консалтинговых компаний часть работала с помощью системы ИИ, часть — без неё. Результат зависел не от инструмента самого по себе, а от типа задачи.

В задаче без единственно верного ответа — разработке нового продукта для целевого рынка — ассистированные консультанты справились заметно лучше: в среднем на 32% выше оценка качества итогового текста, на 25,1% быстрее до контрольной точки в работе, доля завершивших задание выросла примерно с 82% до 91–93%.

В другой задаче того же эксперимента — интерпретации интервью и финансовых показателей для выбора бренда с наибольшим потенциалом роста, где был единственно верный ответ — эффект оказался обратным. Корректность рекомендаций упала с примерно 84,5% без ИИ до 70,6% с ИИ и до 60% у тех, кто вдобавок прошёл обучение работе с промптами — потеря около 19 процентных пунктов.

Хуже того: независимые эксперты, оценивавшие связность и убедительность итоговых текстов вслепую, ставили ИИ-ассистированным рекомендациям более высокие оценки — даже внутри выборки неверных решений. Хорошо написанный текст маскировал ошибку для того, кто читает готовый документ, а не восстанавливает ход рассуждения по исходным данным.

Ту же асимметрию можно увидеть и на уровне архитектуры агентных систем. Одна из крупных корпоративных платформ, столкнувшись с тем, что исправление одного сбоя агента обычно провоцирует новые сбои в другом месте системы, перешла на правило: изменение засчитывается только если оно не откатывает назад ни одну из уже пройденных задач. На одном из тестов в браузере это подняло долю успешно выполненных задач с 43,5% до 93%.

В обоих случаях улучшение в одном измерении — скорости, связности текста, новой отдельной способности — само по себе ничего не говорит о том, не пострадало ли что-то ещё, если это не проверяется отдельно и намеренно.