Qwen выкатили Qwen3-TTS серию открытых моделей синтеза речи, которые ощущаются как платформа для голоса мультиязычность управление стилем клонирование и стриминг в реальном времени

Что внутри самое мясо:

  • свой аудио токенизатор codec tokenizer аудио кодируется в дискретные токены реже шаги быстрее генерация без потери разборчивости и тембра
  • dual track streaming можно начать синтез почти сразу не дожидаясь конца текста фундамент для голосового UX без затыков
  • управление стилем через обычный текст говори как диктор новостей нервный подросток спокойный бархатный голос модель реально пытается исполнить это как задачу

Три режима три продукта:

• CustomVoice готовые голоса пресеты. Хорошо для продакшн озвучки ассистентов системных голосов IVR

• VoiceClone клонирование голоса по короткому примеру несколько секунд. Хорошо для персонализации голос бренда озвучки персонажей в стиле оригинала

• VoiceDesign создание нового голоса по описанию без референс аудио. Хорошо для генерации персонажей голоса под сценарий массового производства контента

Что можно построить вокруг Qwen3-TTS тут начинается бизнес:

• Voice API для приложений /tts text в audio /voices каталог голосов метаданные предпрослушка /style инструкция и пресеты стилей /stream реалтайм поток звука /clone референс плюс текст в озвучку /design описание голоса в голос и озвучку

• Voice Studio панель конструктор голосов через Design библиотека голосов Custom и Cloned тест скрипты A B голоса на типовых репликах экспорт в SDK и интеграции правки через инструкции темп эмоция дикторская подача

• Движок диалогов в реальном времени LLM генерирует текст порциями TTS стримит аудио порциями ощущение живого разговора вместо "подождите я думаю"

• Контент фабрика озвучка статей в аудиоленту авто аудиокниги генерация рекламных роликов локализация один голос много языков

• Голосовые персонажи и аватары игры VR NPC виртуальные ведущие говорящий бренд маскот

https://github.com/QwenLM/Qwen3-TTS