Сбер на этой неделе выпустил GigaChat Ultra с режимом рассуждений (Thinking). Мы сразу прогнали обе версии через 32 управленческих сценария из нашего исследования.
Результат: режим рассуждений ухудшил результат на 3,3%. Не улучшил – ухудшил.
В пяти из восьми категорий Thinking сработал хуже стандартного режима. Самый показательный провал – генерация кода: Ultra набрал 3,86 из 5, а Thinking – 1,25. Модель выдумала метрику «bug rate = deployments / velocity» и сгенерировала полностью нерабочий скрипт.
Второй провал – анализ выручки. Стандартный режим верно посчитал $317 тыс., Thinking «додумался» до $236 тыс. – галлюцинация в промежуточных вычислениях.
Это не баг конкретной модели. Академические работы за 2025–2026 годы фиксируют один и тот же паттерн:
– Неверные ответы содержат вдвое больше thinking-токенов, чем верные – Короткие цепочки рассуждений до 35% точнее длинных – Корреляция между количеством токенов и точностью – отрицательная – Apple показал: для простых задач обычная модель работает лучше reasoning-модели
Где Thinking всё-таки помог – в задачах с множеством факторов: анализ стейкхолдеров, подготовка к переговорам, оценка рисков.
Вывод: режим рассуждений – не кнопка «думай лучше». Это инструмент для узкого класса задач, который вредит во всех остальных. Уметь различать – ключевой навык работы с AI.
Именно этому мы учим в Foundation-модуле курса – как понимать ограничения AI и использовать правильные инструменты для каждой задачи.
Полный разбор с данными и ссылками на исследования: mysummit.school/blog