Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).

Как построить голосового AI-агента, экономящего время пользователя, расскажет Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.

В программе: → Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг → Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины → Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism → Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench) → Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O

Когда? Завтра, 26 мая, в 12:00.

Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Виктору!

Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы | Сетка — социальная сеть от hh.ru