🧠GigaChat-3.1 — самая умная полностью российская модель

Кто-то в Сетке пытался доказать мне, что мы совсем далеки по моделям от США и Китая. Вот пруф — мы отстаем всего на год работы.

Так про что я: вышло обновление семейства GigaChat на MoE-архитектуре, которое идет вровень с Qwen 3 по бенчам. В релизе две модели — Ultra на 702B параметров (36B активных) и Lightning на 10B (1.8B активных). Обе выложили в open source.

На самом деле, интересно тут другое. На рынке сформировались три разных стратегии: — Сбер продолжает создавать модель с нуля, полностью свою. — Яндекс с прошлого года берет веса Qwen для своих моделей (не полностью своя модель, но и не просто дообучение). Он вообще перестал гнаться за мировыми бенчмарками и стал обучать LLM чисто под свои сервисы, нужды и агентские сценарии. — Т-Банк экономно дообучает Qwen средней и малой размерности (32B и 8B) под ру-специфику.

Посмотрим, чей подход в итоге победит.

🧠GigaChat-3.1 — самая умная полностью российская модель
Кто-то в Сетке пытался доказать мне, что мы совсем далеки по моделям от США и Китая. Вот пруф — мы отстаем всего на год работы | Сетка — социальная сеть от hh.ru 🧠GigaChat-3.1 — самая умная полностью российская модель
Кто-то в Сетке пытался доказать мне, что мы совсем далеки по моделям от США и Китая. Вот пруф — мы отстаем всего на год работы | Сетка — социальная сеть от hh.ru