Сбер выложил диффузионную языковую модель GFusion в open source Сбер опубликовал экспериментальную диффузионную языковую модель GFusion на базе GigaChat: GFusion-10B-A1.8B-base и GFusion-10B-A1.8B. Это один из первых российских релизов в новом направлении генеративного ИИ, который может быть полезен исследователям и разработчикам, работающим над собственными диффузионными LLM.

Главное отличие GFusion от классических больших языковых моделей — в принципе генерации. Она не пишет текст строго последовательно, а сначала создает черновик, а затем пошагово его уточняет. Такой подход уже давно используют нейросети для изображений и видео, а теперь его активно развивают и для текста.

По тестам Сбера, GFusion работает до 45% быстрее GigaChat 3, на основе которой она обучалась. Вместе с моделью компания опубликовала и инструменты для ускоренного обучения диффузионных моделей, а также обновила SGLang с поддержкой GFusion.

Проект разработал Даниил Тихонов, который пришел в Сбер стажером, будучи студентом 4-го курса ФКН НИУ ВШЭ. После защиты диплома он остался работать в команде фундаментальных моделей банка.

Диффузионные языковые модели считаются одним из самых перспективных направлений генеративного ИИ. Они могут генерировать токены пачками, лучше использовать ограниченные данные и быть полезными в задачах, где важны скорость и низкая задержка.

#Сбер #GigaChat #GFusion #ИИ #нейросети #openSource #LLM #генеративныйИИ

MAX | 💬 TG | 💙 VK |🔗Сайт | 📝 Дзен🎁 Розыгрыш неттопа iRU


В этом посте были ссылки, но мы их удалили по правилам Сетки

Сбер выложил диффузионную языковую модель GFusion в open source
Сбер опубликовал экспериментальную диффузионную языковую модель GFusion на базе GigaChat: GFusion-10B-A1.8B-base и GFusion-10B-A1.8B | Сетка — социальная сеть от hh.ru