Ранее я уже разбирал тему локальной генерации изображений и контент-завода, когда поднимаешь нейронку у себя (или на сервере), подключаешь API и штампуешь креативы без постоянной зависимости от апи и оплаты сервисов.
И вот сегодня вышла новость: Alibaba выложили в открытый доступ Qwen-Image-Layered — модель, которая генерирует изображения сразу с разбиением на слои.
Пока большинство генеративок делают «плоскую» картинку одним холстом, здесь результат изначально идёт в виде RGBA-слоёв с прозрачностью, почти как готовый PSD-проект.
Главная фишка — это не просто картинка, а семантически разделённые слои: хочешь передвинуть объект, изменить цвет текста, удалить элемент — работаешь только с нужным слоем, а остальное не ломается. Без артефактов и без “semantic drift”, когда правка тянет за собой весь кадр.
Количество слоёв можно задавать промптом. Более того, любой слой можно декомпозировать дальше, получая ещё более детальное разбиение — разработчики называют это «бесконечной декомпозицией».
Обучали модель на реальных PSD-файлах из Photoshop. Код уже на github и Hugging Face.
В этом посте были ссылки, но мы их удалили по правилам Сетки