🚀 Microsoft представила Diff Transformer V2

Обновлённая архитектура ускоряет инференс и улучшает стабильность обучения LLM.

DIFF V2 отказывается от кастомных ядер, совместим с FlashAttention и не снижает скорость декодирования. Вместо устаревшего per-head RMSNorm используется проецируемый token-specific λ, что снижает всплески градиентов. Архитектура позволяет уменьшить количество параметров в проекции выхода, сохраняя эффективность.

Модель показывает на 0.02–0.03 ниже языковую модель, реже возникают аномалии активаций.

#transformer #microsoft #llm #ai #diff_v2

🚀 Microsoft представила Diff Transformer V2
Обновлённая архитектура ускоряет инференс и улучшает стабильность обучения LLM | Сетка — социальная сеть от hh.ru