Полезный ИИ?

Три недели назад пожилой женщине позвонили из “банка” и сообщили о попытке списания денег. Не с приветствия, а сразу с давления. Сценарий стандартный: срочность, страх, код из SMS

Ситуация типичная. Но важен факт - мошенники дозваниваются.

Блокировки номеров помогают слабо. Определители спама работают нестабильно. Разъяснения родственникам забываются. Значит, нужен другой подход.

Цель не в том, чтобы “победить телефонное мошенничество”. Цель проще - сжигать время оператора.

Мошеннический колл-центр - это экономика. Есть зарплата оператора, есть конверсия, есть план. Если один звонок длится 30 минут и не приносит результата, это минус к эффективности.

Так появился голосовой агент, даже можно сказать персонаж, задача которого - не помогать, а тратить чужое время.

Персонаж - Геннадий Петрович, 78 лет. Пожилой "человек" с плохим слухом, медленной реакцией и склонностью к воспоминаниям.

Основная сложность - заставить языковую модель быть не полезной, а “проблемной”. Модель должна хотеть помочь, но не доводить дело до результата. Не отказывать, а затягивать.

Был создан подробный системный промпт с ролью, примерами поведения и ограничениями. Персонаж никогда не говорит “нет”, всегда почти готов назвать данные, но постоянно сбивается.

Ключевые механики поведения: 1. Путаница в цифрах. Вместо номера карты диктуются случайные наборы чисел, которые выдаются за паспорт, партбилет или старый телефон. После 3-4 цифр - сбой и новое воспоминание. 2. Слова-триггеры. При словах “деньги”, “карта”, “код”, “перевод” разговор уходит в сторону - воспоминания о ценах, жалобы на здоровье, истории о соседях. 3. Паузы. Персонаж “уходит” за очками, к комоду, к телевизору. В паузах проигрываются бытовые звуки. Оператор остаётся на линии. 4. Бесконечная почти готовность. Карта “где-то рядом”, SMS “плохо видно”, паспорт “в шкафу”. Прямого отказа нет. 5. Эмоциональные качели. Персонаж пугается, просит подтвердить, что всё безопасно. Оператор тратит время на убеждение.

Техническая архитектура

Система состоит из четырёх компонентов. 1. VAD - определение активности речи. Используется Silero-VAD. Он определяет, говорит ли собеседник. В 80% случаев ответ следует после паузы. В 20% персонаж перебивает короткими репликами, создавая ощущение живого человека. 2. STT - распознавание речи. Применяется Whisper. Для повышения точности добавлен контекст с банковской лексикой. 3. Языковая модель. Используется Llama-3 70B в квантизированном виде 4-bit. Основные критерии выбора - удержание роли и устойчивость под давлением. 4. TTS - синтез речи. Применяется Piper с постобработкой: замедление, лёгкий тремор.

Средняя задержка от конца фразы оператора до начала ответа - около 1.1 секунды.

Связь с телефонной сетью организована через Asterisk и SIP-номер.

Результаты за месяц

41 разговор. Средняя длительность - 8.6 минуты. Максимум - 31 минута 14 секунд. Некоторые операторы перезванивали повторно.

Распределение по времени показывает два сценария: быстрый отказ или длительное зависание.

Суммарно за месяц - около 6 часов разговоров без результата для операторов.

Безопасность

Персонаж не имеет доступа к реальным данным. Все числа генерируются случайно.

Номера родственников, экстренные службы и официальные банковские линии находятся в белом списке и перенаправляются напрямую.

При отсутствии типичных признаков мошенничества вызов переводится на реальный телефон.

Вывод

Телефонное мошенничество строится на эффективности. Любое системное снижение конверсии и рост времени разговора снижает прибыль.

Голосовой агент не устает, не нервничает и не поддаётся давлению. Он продолжает искать очки и вспоминать номер партбилета столько, сколько потребуется.

Каждая потраченная минута - это минута, которую оператор не использует против реального человека.

Полезный ИИ? | Сетка — социальная сеть от hh.ru