Вышла голосовая Gemini 3.8

Новая Gemini 3.8 Flash TTS рассчитана на создание голосов персонажей и подробную настройку озвучки. Вместе с ней вышла Flash-Lite TTS под массовый дубляж, аудиоконтент и голосовых агентов с меньшими затратами.

Flash TTS позволяет придумать голос с нуля: описать его характер, акцент и звучание обычным текстом. Поддерживаются более 100 языков, включая русский. В готовой библиотеке больше 2000 голосов. Можно клонировать голос по 30-секундному образцу, но для этого потребуется отдельная запись согласия его владельца.

Обе модели позволяют управлять каждой репликой: задавать темп, эмоции, шёпот, смех и вздохи. Из одного сценария можно сделать диалог двух персонажей. По заявлению Google, модели сохраняют тембр и качество речи на протяжении многочасовой озвучки — например, аудиокниги.

Пользоваться можно в Gemini API, Google AI Studio и Gemini Notebook. Всё сгенерированное аудио получает водяной знак SynthID.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech