Обзор что еще придумали в Open Source LLM за последние два месяца: внутри статьи хорошее сравнение архитектур и то, как авторы вдохновляются идеями друг друга

1. Почти у всех переход на Sliding Window Attention. Контекстные окна существенно растут, при этом размеры самих моделей почти не увеличиваются. Но в MiniMax M2.5 остались Grouped-Query Attention (GQA) - и выехали чисто на данных в кодинг задачах

2. Использование QK-Norm как некоего аналога RMSNorm (еще со времен Gemini 3).

3. Многие начинают строить мультимодальные модели. Например, в Kimi k2.5 претрейн на изображениях на ранних стадиях обучения оказался особенно полезен

4. Текущий опенсорс - GLM-5 от Z.ai (и это не дипсик): на момент выхода по метрикам модель была на уровне GPT-5.2/Opus 4.5 и Gemini 3 Pro. Удивительно, что внутри там доработанный DeepSeek-V2, но с измененными параметрами, особенно в части количества активных экспертов.

5. Step 3.5 Flash (внутри модель на 196B): Качество сопоставимо с DeepSeek (по бенчмаркам даже лучше, хотя на LMSYS Chatbot Arena ситуация иная), при этом модель в три раза эффективнее по скорости. Архитектурно это почти тот же DeepSeek с MoE, но с меньшим числом параметров и более продвинутым Multi-Token Prediction (генерирует 3 дополнительных токена вместо одного). Он кстати топ2 на openrouter по потреблению токенов

Обзор что еще придумали в Open Source LLM за последние два месяца: внутри статьи хорошее сравнение архитектур и то, как авторы вдохновляются идеями друг друга
1 | Сетка — социальная сеть от hh.ru