Speech-to-Speech: будущее уже здесь
Традиционный путь: голос → текст → LLM → текст → голос.
_...каждое преобразование теряет качество и добавляет задержку _ Новый путь: speech-to-speech. Звук сразу в звук, минуя текст
Преимущества:
— Меньше задержка (200-400ms вместо 1-2 сек) — Сохраняются эмоции и интонации — Лучше понимание контекста (паузы, перебивания)
Кто делает:
— OpenAI экспериментирует с GPT-4o audio — Google Gemini Live API — Несколько стартапов (Retell, Vapi и др.)
Когда в продакшне: уже работает в бета-режиме, к концу 2026 будет стандартом.
Мы уже тестируем speech-to-speech, следите за релизами.