Досмотрел интервью со Scott Stephenson(Deepgram) и немного поигрался с их демкой voice agent api.

Создавать интерактивную диалоговую систему, имея под рукой технологии синтеза, распознавания речи и обработки текста - все равно сложно. Нужно реагировать на перебивания, быстро реагировать и отдавать ответ. Психологически комфортная задержка - 0.7 секунд, от завершения пользователем фразы, до появления первых звуков синтеза. И это очень сложно.

Тут вся эта инженерная часть сделана, и по моим ощущениям - очень хорошо. Отвечает быстро, на перебивания реагирует моментально и стабильно, даже мой корявый английский распознает безукоризненно.

Ну и да, внутри - llm агент, который знает свой промпт и помнит контекст разговора.

По прогнозам - Scott считает, что как только подобные агенты станут экономически эффективнее коллцентров на Филлипинах(а это в ближайшие год-два произойдет) - их использование станет массовым.

А голосовые интерфейсы пользователя, в целом - не вытеснят все остальные, но займут свое достойное место в одном ряду с текстом и тапаньем.

#ml #ai #speech #agent #llm #asr #tts #podcast