Новый синтез речи
Коллеги представили обновленную версию синтеза речи, разработанную командой синтеза речи. Новая версия основана на GigaChat 3b и отличается улучшенным качеством звучания, новыми возможностями и большей естественностью голосов. Основные изменения и нововведения 1. Токенизаторы речи Для повышения эффективности обработки звука команда использовала специальные методы токенизации, снижающие размерность звука с десятков тысяч чисел в секунду до десятков. Такой подход значительно упрощает обработку данных и повышает производительность системы. 2. Новая архитектура Команда внедрила инновационную архитектуру, позволяющую моделировать текстовые токены как акустические. Это позволило создать систему, которая способна преобразовывать текст в звук гораздо быстрее и точнее, чем традиционные модели. 3. Разнообразие данных Сбор данных стал ключевым фактором успеха проекта. Команда собрала огромное количество разнообразной и качественной информации, что обеспечило высокое качество синтезированных голосов. Особое внимание уделялось качеству разметки данных, что позволило избежать многих ошибок и повысить точность моделей. 4. Естественность голосов Одним из основных достижений является достижение естественного звучания голосов. Ранее голоса звучали слишком формально и искусственно, но новая система позволила передать оттенки живой речи, делая общение с ассистентами более комфортным и привычным. 5. Поддержка инструкций Система поддерживает инструкции, позволяющие настраивать тон, темп, громкость и другие характеристики голоса. Это открывает широкие возможности для кастомизации и адаптации голосов под конкретные задачи. 6. Клонирование голосов Кроме того, новая система позволяет клонировать голоса, создавая точные копии оригинальных голосов. Это достигается благодаря специальной технике few-shot learning, которая использует ограниченный набор примеров для обучения модели. Методы оценки качества Качество синтеза оценивается несколькими методами: • Side-by-side (SBS) — прямое сравнение двух моделей. • Human vs Robot (HVR) — оценка степени натуральности звучания. • Pronunciation Sentence Error Rate (PSER) — выявление ошибок в произношении. Все эти метрики показывают значительное улучшение по сравнению с предыдущими версиями. Подробнее на habr