⚡️Сегодня мои бывшие коллеги из SberDevices (а ныне из большого Сбера) выкатили в open-source два свежих релиза GigaChat и рассказали об этом на Хабре. Поверьте, там есть о чём почитать. Первая моделька — GigaChat 3 Lightning, компактная MoE-модель (≈10B общих, ≈1.8B активных). Работает локально на ноутбуке, отлично подходит для быстрых экспериментов и обучения на коленке. А вот на второй стоит остановиться отдельно. GigaChat 3 Ultra Preview — новый флагман с 702 миллиардами параметров, из которых 36 миллиардов активны при генерации токена. В чём крутость 702B-A36B: 🔘 Архитектурно ребята вдохновлялись идеями DeepSeek V3, где удачно сочетаются MoE с общими экспертами, MTP (Multi-Token Prediction) и MLA (Multi-head Latent Attention), а практические детали уже отработаны на уровне классов Hugging Face. 🔘 Pretrain-корпус вырос до 14 трлн токенов + ≈5.5 трлн синтетики. Разработчики ГигаЧата добавили 10 языков — от китайского и арабского до узбекского и казахского, — а также расширили набор источников: книги, академические данные, датасеты по коду и математике. Все данные проходят дедупликацию, языковую фильтрацию и автоматические проверки качества при помощи эвристик и классификаторов. 🔘 При подготовке Pretrain-корпуса провели 179 экспериментов, тестируя различные комбинации естественных и синтетических источников: инструктивные данные, STEM-датасеты, «символьные» задачи и другие подходы. 🔘 Выстроили сложную MoE-кухню: балансировка экспертов, контроль перегрузок, мониторинг, чекпойнты по 10 ТБ. 🔘 Увеличили контекст до 128k. Модель обгоняет прошлое поколение по ключевым бенчмаркам. 🔘 Ну и открытая MIT-лицензия даёт нормальную совместимость с open source-экосистемой. Можно брать модель и дорабатывать под себя. Так как мой канал про контент, хочу немного приоткрыть занавес того, как подобные статьи на Хабр готовятся коллегами из Сбера. Спойлер: восхищаюсь этим подходом. За этой и другими статьями Сбера про Гигу и вообще всё, что связано с AI, стоит достаточно большая команда очень крутых специалистов, которые с невероятным энтузиазмом увлечены своим делом. Сложно поверить, но на написание подобной статьи, в бытность моей работы в Сбере, у нас уходило от 5 до 15 дней, и в этом очень большая заслуга непосредственно инженеров. Если супер кратко, процесс всегда выглядел примерно так: 🔘 в преддверии важного релиза мы собирали в чатик всех причастных; 🔘 распределяли зоны ответственности; 🔘 далее ребята-разработчики каждый детально расписывал свои куски текста. Я, как оунер блога и главред в одном лице, полностью координировал процесс: 🔘 собирал куски драфта в статью; 🔘 приводил текст к единому стилю с учётом редполитики и здравого смысла; 🔘 редактировал, вычитывал и писал вводную часть, а также заключение; 🔘 на мне была подготовка визуалов и взаимодействие с командой дизайнеров; 🔘 вся бюрократическая часть по согласованиям; 🔘 верстка и публикация. При такой слаженной работе мы готовили порой очень сложные технические тексты в считанные дни. И это правда очень крутой опыт. Прекрасно знаю, что так работает далеко не всегда и порой на написание подобного текста уходят месяцы. Поздравляю с релизом всю команду GigaDev. Ребят, вы крутые! Только вперёд🚀 ____ В этом посте были ссылки, но мы их удалили по правилам Сетки