Новости за последний час
UALM пытается собрать в одной модели аудиопонимание, генерацию и рассуждение — без привычного разделения на отдельные стеки для понимания и диффузионные модели для синтеза. Авторы говорят, что их UALM-Gen на базе Qwen2.5-1.5B уже сравним по качеству с диффузионными подходами, а для этого использовали большой датасет, classifier-free guidance, универсальный кодек и self-adaptation через DPO.
Базовая схема — аудиоэнкодер, адаптер и Qwen2.5-7B. Для совмещения задач добавили Modality Alignment, а для мультимодального рассуждения — Rich Captions и самокритицизм, чтобы модель лучше тянула диалог, обогащала запросы и не терялась на сложных звуковых сценах. Код и демо уже доступны, веса пока нет — и это как раз тот случай, где хочется посмотреть не на слайды, а на реальное поведение.
Источники: Data Science by ODS.ai, Habr AI, Habr AI, Habr AI
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки