Я ещё задумался над идеей создания аудиовизуальных образов
Если со средней квадратической для измерения фактической громкости звука и так все ясно, то здесь это не в прямом смысле генерация, а анализ звукового спектра, соотношение цвета к тональностям, а также отделение вокала от инструментала.
Что-то наподобии локального искусственного интеллекта, но его область касается только машинного слуха. Все первоначальные данные для обработки аудио записываются человеком, а потом на основе этих же данных ИИшка ищет элементы вокала и создает отдельный индикатор громкости.
Берём не все, а лишь характерные черты композиции. Можно, конечно, пойти своим путём и написать графические паттерны прямо в файле и подсветку для произносимых слов.
В условиях того, что часто публикуются композиции без мультитрека и текстов, это довольно нетривиальная задача, но её можно попробовать сделать на примерах той же Мадонны, Квина, Майкла Джексона или Пет Шоп Бойсов.
Меня бы за такое отфутболили, но у меня такая идея сложилась.