А вот забавная работа, уже на уровне самой задачи, которую пытаются решать - не видел раньше такого. Ниже авто-саммари: Идея. Zero-shot TTS требует reference audio для клонирования голоса. Но что если есть только фото? (Исторические персоны, персонажи видеоигр.) F2S = Face-to-Speech: предсказывает правдоподобный голос из одного статичного фото лица.
Архитектура. Frozen StyleTTS 2 (генератор стиля/голоса не трогают) + легковесный Face Adapter, который берёт face-recognition фичи (из предобученной face-encoder) и мапит их в style-пространство StyleTTS. Upper blocks face-encoder'а софт-тюнятся; StyleTTS полностью заморожен.
Результаты на LRS3 (TED-talk аудио+видео, held-out identities):
— UTMOS (натуральность): 3.7–4.0, что превышает ground truth (3.61)
— Face-to-voice retrieval стабильно выше chance → голос узнаваемо соответствует лицу
— Голос консистентен с target speaker
— Бонус: adapter, обученный на английском, без ретрейна генерирует фluent испанский → face→style mapping language-agnostic
Оговорки. 5 страниц, workshop-уровень (IberSPEECH). «Plausible voice» — не «правильный голос этого человека» (это в принципе невозможно из фото), а правдоподобный. Но цифры сильные.