GigaChat 2 Max набирает 4,23 из 10 в управленческом бенчмарке на 54 моделях. DeepSeek V4 Flash – 7,70. Alice AI от Яндекса – 6,24. Все три доступны в России.
Год назад GigaChat уверенно обходил ChatGPT 4 на российской нормативке – правильно называл статьи 152-ФЗ, оформлял реквизиты, выдерживал формальный стиль. В 2026 году DeepSeek V4 Flash этот разрыв закрыл. На тестовой задаче по персональным данным GigaChat через API перепутал ст. 9 (согласие) со ст. 10 (специальные категории). DeepSeek правильно назвал все применимые статьи и добавил суммы штрафов по КоАП.
Самая неожиданная находка – reasoning-режим GigaChat Ultra. В обычном режиме модель правильно назвала ст. 10 и ст. 11 закона о персональных данных. В reasoning-режиме – сослалась на ст. 8 (общедоступные источники, не имеет отношения к задаче) и пропустила ст. 11 вовсе. Рассуждения выглядели логично, вывод оказался ошибочным. Это подтверждает данные Google Brain (Wei et al., 2022): Chain-of-Thought у небольших моделей провоцирует уверенные, но неправильные цепочки.
Промпт-техники дают 20–30% прироста – повелительное наклонение, трёхэтапная структура (роль + ограничения + формат), запрос аргументов «за» и «против» перед выводом. Но промпты реорганизуют то, что модель уже знает – они не создают знания, которых нет в весах.
Для тех, кто работает с GigaChat в закрытом контуре: инструмент закрывает оформление документов и черновики. Содержание – номера статей, логика выводов, фактическая точность – требует проверки по первоисточнику вне зависимости от модели.
Подробнее о промпт-техниках и интерактивных тестах – GigaChat и DeepSeek на одной задаче, с живым сравнением.