Neil Zeghidour(ex Google, Kyutai) рассказывает о своих работах над AudioLLM, MusicLM и SoundStorm в Google, и затем над moshi.

Очень наглядная эволюция идей и реализаций, аудиопримеры того, как модели на основе семантических и акустических токенов справляются с разными задачами генерации, сколько нужно размеченных данных для каждого случая.

Там еще целый плейлист всякого про аудио фаундейшн модели и кодеки.

#доклад #ml #tts #llm #speech #ai