🎙️ VibeVoice — новый open-source фреймворк от Microsoft Research для синтеза голоса

🚀 Возможности До 90 минут непрерывной речи без склейки. Поддержка до 4говорящих с реалистичной сменой ролей. Кросс-лингвальность и пение — английский, китайский, переключение языков, простая вокализация.

⚠️ Ограничения Только английский и китайский(остальные языки нестабильны). Нет overlapping-речи (реплики не накладываются). Без фоновых эффектов и музыки. Встроены защита от злоупотреблений: аудиопредупреждение и водяной знак. Пока не подходит для real-time: потоковая версия выйдет позже (7B-модель).

🧩 Архитектура

LLM-«директор» — Qwen2.5-1.5B управляет контекстом, распределяет реплики и задаёт структуру диалога. Acoustic Tokenizer (σ-VAE, ~340M) — сжимает аудио ×3200 при 7.5 Гц без потери качества. Semantic Tokenizer — отвечает за содержание речи (похож на Acoustic, но без VAE). Diffusion head (~123M) — «артист», восстанавливающий акустические детали через DDPM, CFG и DPM-Solver. Контекстное обучение — до 65 K токенов ≈ 90 минут аудио, удерживая структуру разговора на длинных отрезках.

🔧 Практика 1.5B-модель: ~7 ГБ VRAM → запускается даже на RTX 3060. 7B-модель: до 18 ГБ VRAM, окно контекста ~32 K (45 минут). В планах: 0.5B (real-time) и 7B (streaming).

🎧 Почему это важно

VibeVoice открывает новый уровень TTS: длительная, выразительная, диалоговая речь. Идеально для подкастов, аудиосериалов, лекций и проектов с персонажами.

https://microsoft.github.io/VibeVoice

MIT-лицензия: открыто для исследований и коммерческих проектов.

🎙️ VibeVoice — новый open-source фреймворк от Microsoft Research для синтеза голоса
🚀 Возможности
До 90 минут непрерывной речи без склейки.
Поддержка до 4говорящих с реалистичной сменой ролей | Сетка — социальная сеть от hh.ru