Speech-to-Speech: будущее уже здесь

Традиционный путь: голос → текст → LLM → текст → голос.

_...каждое преобразование теряет качество и добавляет задержку _ Новый путь: speech-to-speech. Звук сразу в звук, минуя текст

Преимущества:

— Меньше задержка (200-400ms вместо 1-2 сек) — Сохраняются эмоции и интонации — Лучше понимание контекста (паузы, перебивания)

Кто делает:

— OpenAI экспериментирует с GPT-4o audio — Google Gemini Live API — Несколько стартапов (Retell, Vapi и др.)

Когда в продакшне: уже работает в бета-режиме, к концу 2026 будет стандартом.

Мы уже тестируем speech-to-speech, следите за релизами.

Speech-to-Speech: будущее уже здесь | Сетка — социальная сеть от hh.ru