Новый синтез речи

Коллеги представили обновленную версию синтеза речи, разработанную командой синтеза речи. Новая версия основана на GigaChat 3b и отличается улучшенным качеством звучания, новыми возможностями и большей естественностью голосов.    Основные изменения и нововведения    1. Токенизаторы речи  Для повышения эффективности обработки звука команда использовала специальные методы токенизации, снижающие размерность звука с десятков тысяч чисел в секунду до десятков. Такой подход значительно упрощает обработку данных и повышает производительность системы.    2. Новая архитектура  Команда внедрила инновационную архитектуру, позволяющую моделировать текстовые токены как акустические. Это позволило создать систему, которая способна преобразовывать текст в звук гораздо быстрее и точнее, чем традиционные модели.    3. Разнообразие данных  Сбор данных стал ключевым фактором успеха проекта. Команда собрала огромное количество разнообразной и качественной информации, что обеспечило высокое качество синтезированных голосов. Особое внимание уделялось качеству разметки данных, что позволило избежать многих ошибок и повысить точность моделей.    4. Естественность голосов  Одним из основных достижений является достижение естественного звучания голосов. Ранее голоса звучали слишком формально и искусственно, но новая система позволила передать оттенки живой речи, делая общение с ассистентами более комфортным и привычным.    5. Поддержка инструкций  Система поддерживает инструкции, позволяющие настраивать тон, темп, громкость и другие характеристики голоса. Это открывает широкие возможности для кастомизации и адаптации голосов под конкретные задачи.    6. Клонирование голосов  Кроме того, новая система позволяет клонировать голоса, создавая точные копии оригинальных голосов. Это достигается благодаря специальной технике few-shot learning, которая использует ограниченный набор примеров для обучения модели.    Методы оценки качества    Качество синтеза оценивается несколькими методами:  • Side-by-side (SBS) — прямое сравнение двух моделей.  • Human vs Robot (HVR) — оценка степени натуральности звучания.  • Pronunciation Sentence Error Rate (PSER) — выявление ошибок в произношении.    Все эти метрики показывают значительное улучшение по сравнению с предыдущими версиями.    Подробнее на habr