https://www.youtube.com/watch?v=qE673AY-WEI
Пока вы спали, гугл обошел всех по синтезу речи в рамка обучения своей модели Gemini 2.0.
Только теперь это называется Native audio.
С помощью промптов можно управлять экспрессией голоса, заставить говорить шепотом, говорить медленно, быстро, грустно и т.д.
И самое главное, это уже не звучит как роботизированный голос.
Идеальный инструмент озвучки для разработчиков инди игр с небольшим бюджетом)
Пока все это чудо находится в бете и доступно небольшому кругу лиц, потестить не получится.
Зато можно потестить текстовую модель Gemini 2.0 (но только с включенным VPN).