⚡️Сегодня мои бывшие коллеги из SberDevices (а ныне из большого Сбера) выкатили в open-source два свежих релиза GigaChat и рассказали об этом на Хабре. Поверьте, там есть о чём почитать.            Первая моделька — GigaChat 3 Lightning, компактная MoE-модель (≈10B общих, ≈1.8B активных). Работает локально на ноутбуке, отлично подходит для быстрых экспериментов и обучения на коленке.            А вот на второй стоит остановиться отдельно. GigaChat 3 Ultra Preview — новый флагман с 702 миллиардами параметров, из которых 36 миллиардов активны при генерации токена.                  В чём крутость 702B-A36B:      🔘 Архитектурно ребята вдохновлялись идеями DeepSeek V3, где удачно сочетаются MoE с общими экспертами, MTP (Multi-Token Prediction) и MLA (Multi-head Latent Attention), а практические детали уже отработаны на уровне классов Hugging Face.      🔘 Pretrain-корпус вырос до 14 трлн токенов + ≈5.5 трлн синтетики. Разработчики ГигаЧата добавили 10 языков — от китайского и арабского до узбекского и казахского, — а также расширили набор источников: книги, академические данные, датасеты по коду и математике. Все данные проходят дедупликацию, языковую фильтрацию и автоматические проверки качества при помощи эвристик и классификаторов.      🔘 При подготовке Pretrain-корпуса провели 179 экспериментов, тестируя различные комбинации естественных и синтетических источников: инструктивные данные, STEM-датасеты, «символьные» задачи и другие подходы.      🔘 Выстроили сложную MoE-кухню: балансировка экспертов, контроль перегрузок, мониторинг, чекпойнты по 10 ТБ.      🔘 Увеличили контекст до 128k. Модель обгоняет прошлое поколение по ключевым бенчмаркам.      🔘 Ну и открытая MIT-лицензия даёт нормальную совместимость с open source-экосистемой. Можно брать модель и дорабатывать под себя.            Так как мой канал про контент, хочу немного приоткрыть занавес того, как подобные статьи на Хабр готовятся коллегами из Сбера. Спойлер: восхищаюсь этим подходом.            За этой и другими статьями Сбера про Гигу и вообще всё, что связано с AI, стоит достаточно большая команда очень крутых специалистов, которые с невероятным энтузиазмом увлечены своим делом.      Сложно поверить, но на написание подобной статьи, в бытность моей работы в Сбере, у нас уходило от 5 до 15 дней, и в этом очень большая заслуга непосредственно инженеров.            Если супер кратко, процесс всегда выглядел примерно так:      🔘 в преддверии важного релиза мы собирали в чатик всех причастных;      🔘 распределяли зоны ответственности;      🔘 далее ребята-разработчики каждый детально расписывал свои куски текста.            Я, как оунер блога и главред в одном лице, полностью координировал процесс:      🔘 собирал куски драфта в статью;      🔘 приводил текст к единому стилю с учётом редполитики и здравого смысла;      🔘 редактировал, вычитывал и писал вводную часть, а также заключение;      🔘 на мне была подготовка визуалов и взаимодействие с командой дизайнеров;      🔘 вся бюрократическая часть по согласованиям;      🔘 верстка и публикация.            При такой слаженной работе мы готовили порой очень сложные технические тексты в считанные дни. И это правда очень крутой опыт. Прекрасно знаю, что так работает далеко не всегда и порой на написание подобного текста уходят месяцы.            Поздравляю с релизом всю команду GigaDev.      Ребят, вы крутые! Только вперёд🚀        ____   В этом посте были ссылки, но мы их удалили по правилам Сетки