Голосовые тренажеры. Ч1

В рамках личного проекта разработал голосовой тренажер, который позволяет в безопасной среде потренироваться говорить с клиентом.

Такие инструменты все активнее внедряются в обучение, продажи, техподдержку. Профит очевиден - асинхронное обучение, гибкость, приближенность к “боевому” сценарию.

Два основных блока, которые выступают фундаментом: - методология - техническая сторона, включая железо

Ну методолог я со стажем, поэтому здесь сложностей не было.

А вот второй блок стоит особого внимания. Начинал я с текстовых тренажеров и там в плане технической реализации все на порядок проще. Достаточно дергать способную вести диалог и играть роль модель по API, справится тот же яндекс гпт, опен аи. Либо локальная модель, требующая достаточной памяти.

А вот голосовой тренажер требует формулы: STT (транскрибация текста) -> генерация текста -> TTS (озвучка). Добавим сюда бенчмарк, что скорость ответа должна быть не больше 0,8 сек - и получаем очень интересный вызов. А важно еще и качество ответа, красивая озвучка.

Перепробовал разные модели и много тестов, прежде чем получить что-то адекватное. Детали тянут на отдельный пост.

Сегодня пришла мысль - а не сделать ли такой тренажер для тренировки собеседований🤔

Голосовые тренажеры. Ч1 | Сетка — социальная сеть от hh.ru