🗜️ СБЕР сжал нейромонстра в два раза и он стал умнее

Раньше правило было простое: хочешь умнее модель — делай её больше. Предыдущий флагман GigaChat 3.1 Ultra весил 702 миллиарда параметров (это как 702 млрд ручек настройки) и требовал целый дата-центр. Этим летом Сбер выложил в открытый доступ GigaChat 3.5 Ultra — всего 432 миллиарда общих и 28 млрд активных (работает лишь малая часть мозга за раз, это и есть MoE — смесь экспертов, когда включаются только нужные). И она вдруг пишет код лучше, считает точнее и держит длинные документы без потери памяти. Как так? Оказалось, дело не в весе, а в том, как собран мотор.

⚡️ Где ломались все гиганты * KV-кэш в 4 раза меньше (KV-кэш — это оперативная память модели, где она помнит, что уже прочитала). В ту же видеокарту помещается в 2,14 раза больше контекста, пропускная способность выше на 20%, а длинные тексты летят до четырёх раз быстрее. * Стабилизаторы для гиганта: GatedNorm (умный гейт-регулятор после нормализации, который не даёт сигналу взорваться), сэндвич-нормализация (нормирует вход и выход блока, как страховка до и после) и точечный клиппинг в SwiGLU (обрезает выбросы внутри эксперта прямо перед умножением). * Обучение в FP8 (суперэкономный формат чисел) на всех этапах — быстрее на десятки процентов без потери качества, плюс новая ступень Online RL (онлайн-обучение с подкреплением, когда модель учится на живых сравнениях ответов) после SFT и DPO.

🧠 А если бы сила — это не размер, а архитектура? * Эффект второго порядка (последствия последствий): дешевле инференс — больше компаний могут запускать 432B у себя, а не арендовать облако. Это ускоряет появление российских ИИ-агентов (автономных помощников, которые сами ищут, пишут код и жмут кнопки). * Неочевидный инсайт: Сбер отказался от ставки на синтетику. Вместо выдуманных текстов взяли живой веб, прогнали HTML через LLM-парсинг и получили чистый Markdown с сохранением формул и таблиц. Плюс языков кода стало не 16, а больше 600. Итог — база сразу прыгнула по математике и коду. * Контраргумент: «меньше параметров — значит глупее». Не сработало, потому что добавили MTP-головы (дополнительные головы, которые угадывают несколько токенов вперёд и ускоряют генерацию в 2,2 раза). Один дорогой проход — несколько токенов на выходе.

💸 Что это меняет для тебя прямо сейчас * Если ты разработчик, стартап или вуз — модель под MIT лежит на Hugging Face и GitVerse в четырёх версиях: fp8, bf16, GGUF и base для дообучения. Можно поднимать локально на более доступном железе, а обычным людям она уже доступна бесплатно в ГигаЧате. * Риски и оговорки: все вау-цифры про обгон DeepSeek V3.2 — это внутренние замеры Сбера. Независимых лидербордов пока мало, а для запуска всё равно нужны десятки видеокарт. Это не модель для ноутбука.

💡 Мы долго жили в парадигме «больше — значит лучше». GigaChat 3.5 Ultra ломает её: минус 40% веса, а ума больше. Это как перейти от грузовика с прицепом к спорткару с гибридным мотором — едет быстрее, ест меньше, а везёт столько же. И это первый российский гигант, который открыто показывает, как именно он собран, чтобы сообщество могло проверить и улучшить.

👇 Запустишь такую махину локально или будешь звать её через ГигаЧат? 👇

#GigaChat #Сбер #ИИ #Нейросети #OpenSource #MoE #DeepSeek #AI #ML #Код

🗜️ СБЕР сжал нейромонстра в два раза и он стал умнее | Сетка — социальная сеть от hh.ru