Neil Zeghidour(ex Google, Kyutai) рассказывает о своих работах над AudioLLM, MusicLM и SoundStorm в Google, и затем над moshi.
Очень наглядная эволюция идей и реализаций, аудиопримеры того, как модели на основе семантических и акустических токенов справляются с разными задачами генерации, сколько нужно размеченных данных для каждого случая.
Там еще целый плейлист всякого про аудио фаундейшн модели и кодеки.