Китайцы создали нейросеть, которая пишет целый хит за 20 сек
Раньше чтобы написать песню нужен был битмейкер, вокалист, аранжировщик и студия. Нейросети делали только обрывки на 30 секунд, которые звучали как будто радио ловит помехи. Все знали: длинную песню с душой машина не потянет.
Всё поменялось. Лаборатория MiniMax выпустила Music 3 — компактную, но очень злую модель. Она делает полноценные треки до 5 минут: вступление, куплет, припев, бридж, аутро, с живым вокалом и инструментами. И главное — открытые веса (готовые файлы модели, которые можно скачать и запустить у себя). Без подписки, без лимитов, прямо на своей видеокарте. Попробовать можно и в браузере.
🧩 Почему раньше музыка от нейросетей сыпалась Долгая структура — больное место. Обычная модель забывает мотив уже через минуту (теряет нить, как человек, который забыл, о чём начал рассказ). Здесь сделали гибрид: глобальная модель на 8 млрд параметров держит смысл и форму, а локальная на 0,6 млрд дорисовывает детали звука. Старый звук хрустел из-за сжатия. Использовали RVQ (способ нарезать звук на мелкие цифровые кусочки, как конструктор). Теперь добавили Flow-VAE (умный декодер, который склеивает эти кусочки в гладкий, живой звук) и сохранили скрытое состояние (внутреннюю память о тембре). Требовалась ферма серверов. Теперь полная точность влезает в 24 ГБ видеопамяти, а с послойной выгрузкой (когда часть модели спит в обычной памяти) — даже в 8 ГБ карточку.
🤹🏻♀️ Главный трюк, который скрывают за словом компактная Разделение труда. Одна часть модели думает, КАК должна развиваться песня, вторая — КАК она звучит. Это как композитор и звукорежиссёр в одном флаконе, но работают раздельно. Ты — дирижёр. Пишешь текст с тегами, и даёшь описание в трёх блоках: что за жанр и темп, какой вокал (пол, тембр, манера), какие инструменты и как они меняются по секциям. Нейросеть слушается, а не фантазирует. Контраргумент: это игрушка для мемов. Не работает. Бизнесы уже гонят на ней фоновую музыку для рекламы и видео без авторских отчислений, а разработчики встраивают её в свои приложения через Hugging Face, GitHub и ModelScope. Игрушка не выкладывает веса под лицензией, которая разрешает коммерцию.
💸 Как это бьёт по нам прямо сейчас Для каждого из нас — музыка стала как фото на телефон. Захотел колыбельную с именем ребёнка, трек для пробежки в стиле 80-х или песню про свой бар — написал промпт и готово. Порог входа рухнул. Риски честные: на сложных вокальных местах нейросеть ещё палится (протяжные ноты, шёпот, крик), лицензия CC-BY-SA 4.0 (можешь использовать, но обязан указать автора и делиться доработками на тех же условиях), плюс вопрос — что будет с живыми музыкантами, когда фоновая музыка станет почти бесплатной.
💡 Мы долго думали, что музыка — это магия, доступная избранным. Сначала ноты, потом студии, потом лейблы. Сейчас магия упакована в файлы, которые весят меньше игры и запускаются дома. Это не смерть музыки, а её размножение. Чем больше людей сможет выразить чувство мелодией, тем больше у нас шансов услышать что-то настоящее, а не только то, что пропустил продюсер.
👇 Какую песню ты бы сгенерировал первой — про любовь, про свой город или про кота, который спит на клавиатуре? 👇
#нейросеть #музыка #MiniMax #технологии #ии #MusicAI #openSource #будущее #креатив #генерация
· 16.08
И где те хиты звучат?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён