Сбер разместил на Hugging Face веса экспериментальной диффузионной языковой модели GFusion — версии GFusion‑10B‑A1.8B‑base и GFusion‑10B‑A1.8B. Ключевая особенность подхода заключается в изменении схемы генерации текста: вместо последовательного формирования токенов слева направо модель сначала создает структурный набросок ответа, а затем подставляет подходящие слова в сформированную рамку.

На текущем этапе GFusion генерирует за один шаг блок из 32 токенов, что соответствует примерно одному предложению до 15 слов. В тестах модель Сбера демонстрирует прирост скорости до 45 % по сравнению с GigaChat 3, на базе которой она разработана, при снижении качества на 2–4 процентных пункта.

Подход к использованию диффузии в языковых моделях развивается и в других организациях. Стартап Inception Labs ведет разработку диффузионных языковых моделей. Китайские исследователи представили проект LLaDA (Large Language Diffusion with mAsking). Google опубликовала версию Diffusion Gemma — она генерирует 256 токенов за шаг и, по данным компании, ускоряет создание текста и простого кода в четыре раза, хотя по большинству бенчмарков первая версия модели уступает Gemma 26B.

Ссылки: https://huggingface.co/ai-sage/GFusion-10B-A1.8B-base https://huggingface.co/ai-sage/GFusion-10B-A1.8B

Сбер разместил на Hugging Face веса экспериментальной диффузионной языковой модели GFusion — версии GFusion‑10B‑A1.8B‑base и GFusion‑10B‑A1.8B | Сетка — социальная сеть от hh.ru