На днях группа анонимов выкатила OmniVoice - модель для клонирования голоса. Это 1 Shot TTS (test to speech). Ей достаточно всего 3–5 секунд примера, чтобы начать говорить вашим (или чужим) голосом.
Если у вас есть 16 ГБ видеопамяти, можно прямо локально и бесплатно собрать мини-студию озвучки.
Мой Mac M2 16Gb не летает, но вполне справляется с такими задачами.
Вот набор моделей, которые можно запустить локально. 1. Whisper (OpenAI) превращает аудио в текст и субтитры. Бесплатно, быстро, точно. 2. Gemma 4 9B (Google) прогоняем через нее текст. Она расставит знаки препинания и, главное, тэги для эмоций. Работает на 16 ГБ и соображает очень прилично. 3. OmniVoice — берет этот текст и озвучивает любым голосом.
OmniVoice понимает контекст и эмоции. Можно вставить в субтитры тэги типа [sigh] или [laughter] и модель не прочитает слово «смех», а реально усмехнется в этом месте. Посмотреть и скачать модель можно тут: huggingface.co/k2-fsa/OmniVoice
Вот пример работы. Озвучил лекцию Мэтта про скиллы для обсуждения разработки софта с моделью. Обратите внимание на 13:15 - там тот самый смешок. Мэтт усмехается в переводе как живой человек. https://vkvideo.ru/video-238285685_456239017 Саму лекцию рекомендую всем, кто работает с моделями через агентов, там про то, как говорить с моделью на одном языке используя его специализированные Skills.
Есть вопросы по настройке - пишите в комменты, разберемся.