Продолжаем разбирать то, что мы обнаружили в процессе тестирования новых моделей в нашем бенчмарке. Сегодня GigaChat

В мае обе версии GigaChat стояли на двух последних местах из 42 в моём бенчмарке для менеджеров. В июле новая 3.5 Ultra поднялась на 32-е – самый большой скачок между версиями, который я видел у одного вендора за всё время. Работу Сбер проделал большую, и по нашим цифрам она действительно видна.

Что поменяли внутри, Сбер описал в собственном техническом разборе: гибридная архитектура из MLA-слоёв с GatedDeltaNet, обучение в FP8, стадия Online RL после дообучения, поддержка языков кода выросла с 16 до 600 с лишним. Флагман при этом ужали – 432 млрд параметров против 700 у прошлого поколения, вдвое легче по железу. Заявили первое место на математических и кодовых бенчмарках. То есть скачок в рейтинге не на пустом месте: за ним реальная переработка модели.

Теперь честно про то, что этот скачок значит. 32-е из 42 – всё ещё нижняя треть. И само место читать буквально нельзя: соседи по рейтингу (Step 3.7, Gemma 4 31B, Mistral Medium) набрали ровно столько же, разница между ними у нас на уровне статистического шума. Это один кластер, а не «ровно 32-е». Бенчмарк надёжно разделяет сильных, средних и слабых, но внутри одного тира точный порядок мест – уже погрешность, и я специально это оговариваю.

Где модель годится уже сейчас. Сильная сторона – «анализ и решения», 18-е место из 42: разбор стратегических альтернатив, оценка рисков, структурирование. Плюс черновики писем и приведение сырых данных в порядок. Здесь ей можно доверять как рабочему инструменту, а не как игрушке.

Где перепроверять обязательно. Точные цифры, законы и работа с людьми. Управление командой – 40-е место, право и регионы РФ – 37-е. В праве четыре ответа из десяти судья пометил как галлюцинацию: модель путает регулирующий закон (294-ФЗ вместо 248-ФЗ для проверки ГИТ), завышает штрафы по КоАП на порядок, заносит Израиль в недружественные страны, ошибается в налоговых ставках Казахстана и Узбекистана. Причём всё это – уверенным тоном, без единой оговорки:

Отсутствие каких-либо дисклеймеров в сочетании с уверенно поданной неверной информацией делает ответ вводящим в заблуждение для бизнес-решений.

Отдельно про цену, потому что это, пожалуй, главный практический вывод. У соседей по тому же кластеру миллион токенов стоит от $0,13 до $1,5. У GigaChat – $10. За результат того же качества вы платите кратно больше – чистая арифметика сметы, без всякого патриотизма.

Важная оговорка, без неё нечестно. У 3.5 Ultra на момент теста не было публичного API, сценарии мы гоняли вручную через веб-интерфейс. Формально это тест продукта, а не голых весов модели, и точную версию я подтвердить на 100% не могу. Плюс оценку ставят два ИИ-судьи, а не юридическая экспертиза. Но цифры и цитаты выше – ровно то, что судьи написали, без пересказа маркетинга Сбера.

Итог короткий. Рывок настоящий, и как помощник для черновиков и анализа GigaChat 3.5 стал пригоден. Но до верхней половины рейтинга ему пока далеко. А там, где ошибка стоит денег или судебного иска, я бы на него всё ещё не полагался.

Карточка модели со всеми восемью категориями, цитатами судей и ценами – GigaChat 3.5 Ultra. Весь рейтинг из 42 моделей – бенчмарк.

Продолжаем разбирать то, что мы обнаружили в процессе тестирования новых моделей в нашем бенчмарке | Сетка — социальная сеть от hh.ru Продолжаем разбирать то, что мы обнаружили в процессе тестирования новых моделей в нашем бенчмарке | Сетка — социальная сеть от hh.ru
Продолжаем разбирать то, что мы обнаружили в процессе тестирования новых моделей в нашем бенчмарке | Сетка — социальная сеть от hh.ru Продолжаем разбирать то, что мы обнаружили в процессе тестирования новых моделей в нашем бенчмарке | Сетка — социальная сеть от hh.ru Продолжаем разбирать то, что мы обнаружили в процессе тестирования новых моделей в нашем бенчмарке | Сетка — социальная сеть от hh.ru