🚀 Microsoft представила Diff Transformer V2
Обновлённая архитектура ускоряет инференс и улучшает стабильность обучения LLM.
DIFF V2 отказывается от кастомных ядер, совместим с FlashAttention и не снижает скорость декодирования. Вместо устаревшего per-head RMSNorm используется проецируемый token-specific λ, что снижает всплески градиентов. Архитектура позволяет уменьшить количество параметров в проекции выхода, сохраняя эффективность.
Модель показывает на 0.02–0.03 ниже языковую модель, реже возникают аномалии активаций.