У Гриши Стерлига содержательно.

Сбер докатил в прод решение на основе VITS. VITS облегченный и стриминговый, за счет этого - влез на CPU в приемлемые метрики. Не сказали, правда, на скольких CPU. Рост качества синтеза у них значительный. Впрочем, мы сравнивались с их свежими моделями, и пока что, идем с ними наравне. CPU решение с сопоставимыми метриками у нас тоже есть, знать бы, конечно, как мы в сравнении с ними по TCO. На основе VITS мы тоже пытались похожее решение сделать, но нам не понравилось - уменьшенный VITS у нас плохо звучал и обучение не очень сходилось, а полноценный - тяжеловат. Но Сбер, похоже, в него имел возможность намного больше усилий вложить. В клонинге, помимо стандартного практически GST и напрашивающегося ICL, они реализовали дообучение модели под промпт прям на сервере. Говорят, докинуло 12% к метрикам(SBS similarity). Помогает с интонациями, скоростью, акцентами и окружением, фоновый шум итп. LLM-TTS. На текущем этапе - сильно проигрывает их же проду в целом, хотя выигрывает по человечности. Любопытная метрика PSER - для правильно синтезированных аудио, где разметчики не нашли к чему придраться. Ну и показали черрипик мультимодального гигачата, с дисклеймером, что пока - он очень сырой. #tts #ml #ai