🎙 ГОЛОС СТАЛ КОНСТРУКТОРОМ Раньше для клонирования, очистки и редактирования голоса приходилось собирать целый ящик инструментов. Теперь Tencent открыли AuK — модель, которой можно объяснять задачу обычным текстом. 🧠 КАК ЭТО ПОНИМАТЬ? • 🧠 Одна модель для работы с голосом Tencent выкатили в open-source AuK — нейросеть на 1,5 млрд параметров. Она понимает текстовые инструкции и меняет аудио под задачу.
• 🎭 Голос можно клонировать Достаточно загрузить образец речи — модель соберёт цифровую копию с похожими тембром, интонациями и манерой.
• ✍️ Голос можно создать с нуля Опишите персонажа словами: например, спокойный рассказчик или эмоциональный ведущий. AuK сгенерирует подходящую речь без готовой записи.
• 🔧 Запись можно исправить после съёмки Модель меняет слова в готовом аудио, сохраняя качество и фон. Оговорка больше не обязательно означает повторную запись.
• 🎛 Настройки задаются текстом Можно управлять эмоцией, тембром, скоростью, высотой, акцентом, шёпотом, смехом и дыханием. 🔥 ЧТО МЕНЯЕТСЯ? ▸ Раньше нужен был набор сервисов Клонирование, озвучка, очистка и разделение голосов обычно жили в разных инструментах. AuK собирает эти задачи в одном месте 🎯
▸ Сложные слайдеры уступают место словам Не нужно долго искать правильную настройку. Пишете, что хотите услышать, и модель пытается это сделать 🗣
▸ Аудио теперь можно редактировать как текст Записали фразу с ошибкой — заменили её инструкцией, а не пересъёмкой. Для подкастов и видео это похоже на функцию «исправить опечатку», только для голоса 🎙
▸ С песнями открывается отдельный простор AuK умеет менять текст трека, сохраняя мелодию, ритм и оригинальный вокал. Для музыкальных экспериментов это заметно интереснее обычной озвучки 🎵
▸ Открытый код меняет правила игры Код и веса доступны по лицензии MIT, а запуск возможен локально. Данные не обязательно отправлять в облако — приятная редкость в мире «загрузите всё на наш сервер» 🔐 💼 КОГО ЭТО ЗАДЕНЕТ? ▸ Креаторы смогут быстрее делать дубляж Потенциальный сценарий: автор загружает ролик, задаёт нужный голос и получает версии для разных языков. Финальную проверку произношения всё равно лучше оставить человеку 🌍
▸ Игры получат больше голосовых NPC Потенциальный сценарий: разработчик задаёт характер персонажа и генерирует его реплики без отдельной записи каждой фразы. Особенно полезно для быстрых прототипов 🎮
▸ Подкасты станет проще править Если ведущий оговорился, запись можно попробовать исправить прямо в готовом аудио. Но согласие на использование голоса и контроль результата никуда не исчезают ✍️
▸ AuK-Flash нацелен на быстрые тесты Облегчённая версия выдаёт результат за четыре шага и работает в 4,5 раза быстрее основной. Это подходит для приложений реального времени и быстрых итераций ⚡
▸ Локальный запуск пригодится исследователям Модель можно использовать как открытую базу для экспериментов, а интеграция с ComfyUI — для визуальных пайплайнов. Насколько удобно это будет на практике, покажет сама установка и качество на конкретных задачах 🧪 🔹🔹🔹🔹🔹🔹 🏆 ЛУЧШИЕ ПРОМПТЫ В PROJECT POOL 🤖 ИИ АГЕНТЫ — собери своего 📈 ИИ-агенты. - просто и понятно #новости #news #нейросети #ии
В этом посте были ссылки, но мы их удалили по правилам Сетки