Полезный ИИ?
Три недели назад пожилой женщине позвонили из “банка” и сообщили о попытке списания денег. Не с приветствия, а сразу с давления. Сценарий стандартный: срочность, страх, код из SMS
Ситуация типичная. Но важен факт - мошенники дозваниваются.
Блокировки номеров помогают слабо. Определители спама работают нестабильно. Разъяснения родственникам забываются. Значит, нужен другой подход.
Цель не в том, чтобы “победить телефонное мошенничество”. Цель проще - сжигать время оператора.
Мошеннический колл-центр - это экономика. Есть зарплата оператора, есть конверсия, есть план. Если один звонок длится 30 минут и не приносит результата, это минус к эффективности.
Так появился голосовой агент, даже можно сказать персонаж, задача которого - не помогать, а тратить чужое время.
Персонаж - Геннадий Петрович, 78 лет. Пожилой "человек" с плохим слухом, медленной реакцией и склонностью к воспоминаниям.
Основная сложность - заставить языковую модель быть не полезной, а “проблемной”. Модель должна хотеть помочь, но не доводить дело до результата. Не отказывать, а затягивать.
Был создан подробный системный промпт с ролью, примерами поведения и ограничениями. Персонаж никогда не говорит “нет”, всегда почти готов назвать данные, но постоянно сбивается.
Ключевые механики поведения: 1. Путаница в цифрах. Вместо номера карты диктуются случайные наборы чисел, которые выдаются за паспорт, партбилет или старый телефон. После 3-4 цифр - сбой и новое воспоминание. 2. Слова-триггеры. При словах “деньги”, “карта”, “код”, “перевод” разговор уходит в сторону - воспоминания о ценах, жалобы на здоровье, истории о соседях. 3. Паузы. Персонаж “уходит” за очками, к комоду, к телевизору. В паузах проигрываются бытовые звуки. Оператор остаётся на линии. 4. Бесконечная почти готовность. Карта “где-то рядом”, SMS “плохо видно”, паспорт “в шкафу”. Прямого отказа нет. 5. Эмоциональные качели. Персонаж пугается, просит подтвердить, что всё безопасно. Оператор тратит время на убеждение.
⸻
Техническая архитектура
Система состоит из четырёх компонентов. 1. VAD - определение активности речи. Используется Silero-VAD. Он определяет, говорит ли собеседник. В 80% случаев ответ следует после паузы. В 20% персонаж перебивает короткими репликами, создавая ощущение живого человека. 2. STT - распознавание речи. Применяется Whisper. Для повышения точности добавлен контекст с банковской лексикой. 3. Языковая модель. Используется Llama-3 70B в квантизированном виде 4-bit. Основные критерии выбора - удержание роли и устойчивость под давлением. 4. TTS - синтез речи. Применяется Piper с постобработкой: замедление, лёгкий тремор.
Средняя задержка от конца фразы оператора до начала ответа - около 1.1 секунды.
Связь с телефонной сетью организована через Asterisk и SIP-номер.
⸻
Результаты за месяц
41 разговор. Средняя длительность - 8.6 минуты. Максимум - 31 минута 14 секунд. Некоторые операторы перезванивали повторно.
Распределение по времени показывает два сценария: быстрый отказ или длительное зависание.
Суммарно за месяц - около 6 часов разговоров без результата для операторов.
⸻
Безопасность
Персонаж не имеет доступа к реальным данным. Все числа генерируются случайно.
Номера родственников, экстренные службы и официальные банковские линии находятся в белом списке и перенаправляются напрямую.
При отсутствии типичных признаков мошенничества вызов переводится на реальный телефон.
⸻
Вывод
Телефонное мошенничество строится на эффективности. Любое системное снижение конверсии и рост времени разговора снижает прибыль.
Голосовой агент не устает, не нервничает и не поддаётся давлению. Он продолжает искать очки и вспоминать номер партбилета столько, сколько потребуется.
Каждая потраченная минута - это минута, которую оператор не использует против реального человека.