Голос в голос начинался за три секунды
Серийный пайплайн: слушаю, Whisper, LLM, ElevenLabs, выдаю. Казахский, русский, живые менеджеры в одной системе, и диалог начинает рассинхронизироваться из-за пауз. Замерил по session-логам Voximplant: debounce VAD около секунды, полный LLM-прогон еще два-три в зависимости от ответа. На восьмикилогерцовой линии это звучит как робот, который думает.
Узкое место нашлось в механике задержек, а не через перебор: full pipeline структурно не опускается ниже 3.4 секунды. Пробовал стрим-обработку, mini-модель вместо basic - выигрыш в сотни миллисекунд, но архитектурный потолок все равно там. Нужно было убить debounce и переход между этапами.
OpenAI Realtime делает speech-to-speech нативно: микрофон напрямую в семантический VAD, параллелизм вместо очереди, выход голосом через WebSocket. Один API-вызов вместо четырех сервисов. После миграции задержка упала примерно вдвое - около 800 миллисекунд, и диалог наконец звучит как разговор.
Урок: когда структурный предел не дает выигрыша, смотри инструмент, а не код. Четыре отдельных провайдера - это архитектурная граница, переставить их местами не поможет.
#голосовойбот #voximplant #openai #задержка #реалтайм #казахскийязык #разработка