🧠GigaChat-3.1 — самая умная полностью российская модель
Кто-то в Сетке пытался доказать мне, что мы совсем далеки по моделям от США и Китая. Вот пруф — мы отстаем всего на год работы.
Так про что я: вышло обновление семейства GigaChat на MoE-архитектуре, которое идет вровень с Qwen 3 по бенчам. В релизе две модели — Ultra на 702B параметров (36B активных) и Lightning на 10B (1.8B активных). Обе выложили в open source.
На самом деле, интересно тут другое. На рынке сформировались три разных стратегии: — Сбер продолжает создавать модель с нуля, полностью свою. — Яндекс с прошлого года берет веса Qwen для своих моделей (не полностью своя модель, но и не просто дообучение). Он вообще перестал гнаться за мировыми бенчмарками и стал обучать LLM чисто под свои сервисы, нужды и агентские сценарии. — Т-Банк экономно дообучает Qwen средней и малой размерности (32B и 8B) под ру-специфику.
Посмотрим, чей подход в итоге победит.
· 26.03
Гигачат - самая тупая нейросеть из трёх, мной используемых. На первом месте у меня идёт Дипсик, потом Алиса про, и далеко в хвосте - Гигачат. Чаще всех косячит, врёт, или пишет - нет информации. На бенчи плевать - я сужу по результатам.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён