Stability AI опенсорснули StableAudio - модельку для генерации музыки и звуковых эффектов.
Это урезанная версия платной версии модели, тут поддерживается только text-to-audio режим, а сгенерированные файлы могут быть продолжительностью до 47 секунд. Да и в коммерческих целях использовать нельзя 🤷🏻♂️
Но можно зафайнтюнить на своих данных - загрузить примеры своих аудио-файлов, чтобы генерации были именно на их основе.
Модель и веса доступны на Hugging Face.