ИИ-оператор на линии: меряю его стандартом для людей

Месяц назад вывел ИИ-оператора на ночную линию. Рассказываю не про успех, а про то, что стало видно.

Ночью линия работала формально: обращения принимались, но до результата доводилась треть. Остальное переносилось на утро.

Собрал ИИ-оператора на своём сервере, без покупной платформы, и завёл его пятым сотрудником отдела: с именем, сменой и зоной ответственности.

Четыре рабочих дня тестового запуска, ежедневные доработки по разбору живых диалогов: доля обращений, доведённых до результата, выросла с 34 до 82 процентов. За весь тестовый период 65. Доступность 99,95, падений не было. Содержание модели обходится примерно в тридцать долларов в месяц.

Но написать я хотел не про это.

Главным решением оказалось не то, какую модель взять, а то, что бота оценивают тем же стандартом качества, что и людей. Те же шестнадцать параметров, та же еженедельная выборка диалогов, тот же разбор промахов, тот же протокол.

И вот что сразу вылезло. По общему баллу за неделю бот дал 97,7 процента. Выглядит отлично, пока не посмотришь по пунктам. «Завершение диалога» у него 82 процента при 96-98 у людей. «Тон и эмоции» 84, и все промахи в технических поломках, там где клиент уже раздражён.

То есть бот не «хуже» и не «лучше» человека. Он ровный там, где работает шаблон, и проваливается там, где нужно чувствовать состояние собеседника. Увидеть это можно было только одним способом: положить его в ту же таблицу качества, что и операторов.

Пока бот живёт в отдельной вселенной «ну это же робот», у него нет ни владельца, ни истории правок, ни цены ошибки. Как только он попадает в общий стандарт, разговор про него становится инженерным: вот пункт, вот разрыв в четырнадцать процентов, вот правка промпта, вот замер через неделю.

Спрошу у коллег: вы своих ботов оцениваете тем же стандартом, что операторов, или у них отдельная система координат?