🎙 ГОЛОС СТАЛ КОНСТРУКТОРОМ Раньше для клонирования, очистки и редактирования голоса приходилось собирать целый ящик инструментов. Теперь Tencent открыли AuK — модель, которой можно объяснять задачу обычным текстом. 🧠 КАК ЭТО ПОНИМАТЬ? • 🧠 Одна модель для работы с голосом Tencent выкатили в open-source AuK — нейросеть на 1,5 млрд параметров. Она понимает текстовые инструкции и меняет аудио под задачу.

• 🎭 Голос можно клонировать Достаточно загрузить образец речи — модель соберёт цифровую копию с похожими тембром, интонациями и манерой.

• ✍️ Голос можно создать с нуля Опишите персонажа словами: например, спокойный рассказчик или эмоциональный ведущий. AuK сгенерирует подходящую речь без готовой записи.

• 🔧 Запись можно исправить после съёмки Модель меняет слова в готовом аудио, сохраняя качество и фон. Оговорка больше не обязательно означает повторную запись.

• 🎛 Настройки задаются текстом Можно управлять эмоцией, тембром, скоростью, высотой, акцентом, шёпотом, смехом и дыханием. 🔥 ЧТО МЕНЯЕТСЯ?Раньше нужен был набор сервисов Клонирование, озвучка, очистка и разделение голосов обычно жили в разных инструментах. AuK собирает эти задачи в одном месте 🎯

Сложные слайдеры уступают место словам Не нужно долго искать правильную настройку. Пишете, что хотите услышать, и модель пытается это сделать 🗣

Аудио теперь можно редактировать как текст Записали фразу с ошибкой — заменили её инструкцией, а не пересъёмкой. Для подкастов и видео это похоже на функцию «исправить опечатку», только для голоса 🎙

С песнями открывается отдельный простор AuK умеет менять текст трека, сохраняя мелодию, ритм и оригинальный вокал. Для музыкальных экспериментов это заметно интереснее обычной озвучки 🎵

Открытый код меняет правила игры Код и веса доступны по лицензии MIT, а запуск возможен локально. Данные не обязательно отправлять в облако — приятная редкость в мире «загрузите всё на наш сервер» 🔐 💼 КОГО ЭТО ЗАДЕНЕТ?Креаторы смогут быстрее делать дубляж Потенциальный сценарий: автор загружает ролик, задаёт нужный голос и получает версии для разных языков. Финальную проверку произношения всё равно лучше оставить человеку 🌍

Игры получат больше голосовых NPC Потенциальный сценарий: разработчик задаёт характер персонажа и генерирует его реплики без отдельной записи каждой фразы. Особенно полезно для быстрых прототипов 🎮

Подкасты станет проще править Если ведущий оговорился, запись можно попробовать исправить прямо в готовом аудио. Но согласие на использование голоса и контроль результата никуда не исчезают ✍️

AuK-Flash нацелен на быстрые тесты Облегчённая версия выдаёт результат за четыре шага и работает в 4,5 раза быстрее основной. Это подходит для приложений реального времени и быстрых итераций ⚡

Локальный запуск пригодится исследователям Модель можно использовать как открытую базу для экспериментов, а интеграция с ComfyUI — для визуальных пайплайнов. Насколько удобно это будет на практике, покажет сама установка и качество на конкретных задачах 🧪 🔹🔹🔹🔹🔹🔹 🏆 ЛУЧШИЕ ПРОМПТЫ В PROJECT POOL 🤖 ИИ АГЕНТЫ — собери своего 📈 ИИ-агенты. - просто и понятно #новости #news #нейросети #ии


В этом посте были ссылки, но мы их удалили по правилам Сетки