Звук – это картинка?
Нейросети не слышат твой голос – они его видят.
Звуковые файлы для них слишком «сырые», поэтому сначала аудио преобразуют в специальный удобный формат. Достаточно 15 секунд речи и копия голоса готова. Ну, чудеса!
Как же нейросети клонируют голос?
Разбираемся вместе с Василием Сизовым, Lead DS, лидером кластера «CRM и клиентский опыт» в ВТБ в этой статье.
Делись в комментариях, хотел бы услышать свой сгенерированный голос?