🖼 Собираем нейронку для генерации картинок на коленке

Нейронки, которые рисуют картинки по тексту, сейчас везде. Но большинство просто дёргает API, не имея ни малейшего понятия, что там под капотом условного Stable Diffusion.

Для тех, кто хочет разобраться, есть проект miniDiffusion — это полная перереализация Stable Diffusion 3.5, написанная с нуля на чистом PyTorch.

👉🏻 Всего ~2800 строк кода. От VAE и текстовых энкодеров до самого DiT и скриптов для обучения. 👉🏻 Никаких лишних зависимостей. Только PyTorch и необходимый минимум. 👉🏻 Внутри всё самое важное: архитектура DiT, Joint Attention, энкодеры T5 и CLIP, планировщик шума и даже расчёт метрики FID.

Кому это надо? ▫️ Для тех, кто хочет реально разобраться, как эта магия генерации картинок работает под капотом. ▫️ Для тех, кто хочет поковырять архитектуру или обучить что-то своё, не продавая душу дьяволу за понимание официальной репы.

Заглянуть в код можно здесь 👈🏻

🖼 Собираем нейронку для генерации картинок на коленке
Нейронки, которые рисуют картинки по тексту, сейчас везде | Сетка — социальная сеть от hh.ru