Qwen выкатили Qwen3-TTS серию открытых моделей синтеза речи, которые ощущаются как платформа для голоса мультиязычность управление стилем клонирование и стриминг в реальном времени
Что внутри самое мясо:
- свой аудио токенизатор codec tokenizer аудио кодируется в дискретные токены реже шаги быстрее генерация без потери разборчивости и тембра
- dual track streaming можно начать синтез почти сразу не дожидаясь конца текста фундамент для голосового UX без затыков
- управление стилем через обычный текст говори как диктор новостей нервный подросток спокойный бархатный голос модель реально пытается исполнить это как задачу
Три режима три продукта:
• CustomVoice готовые голоса пресеты. Хорошо для продакшн озвучки ассистентов системных голосов IVR
• VoiceClone клонирование голоса по короткому примеру несколько секунд. Хорошо для персонализации голос бренда озвучки персонажей в стиле оригинала
• VoiceDesign создание нового голоса по описанию без референс аудио. Хорошо для генерации персонажей голоса под сценарий массового производства контента
Что можно построить вокруг Qwen3-TTS тут начинается бизнес:
• Voice API для приложений /tts text в audio /voices каталог голосов метаданные предпрослушка /style инструкция и пресеты стилей /stream реалтайм поток звука /clone референс плюс текст в озвучку /design описание голоса в голос и озвучку
• Voice Studio панель конструктор голосов через Design библиотека голосов Custom и Cloned тест скрипты A B голоса на типовых репликах экспорт в SDK и интеграции правки через инструкции темп эмоция дикторская подача
• Движок диалогов в реальном времени LLM генерирует текст порциями TTS стримит аудио порциями ощущение живого разговора вместо "подождите я думаю"
• Контент фабрика озвучка статей в аудиоленту авто аудиокниги генерация рекламных роликов локализация один голос много языков
• Голосовые персонажи и аватары игры VR NPC виртуальные ведущие говорящий бренд маскот