Сбер на этой неделе выпустил GigaChat Ultra с режимом рассуждений (Thinking). Мы сразу прогнали обе версии через 32 управленческих сценария из нашего исследования.

Результат: режим рассуждений ухудшил результат на 3,3%. Не улучшил – ухудшил.

В пяти из восьми категорий Thinking сработал хуже стандартного режима. Самый показательный провал – генерация кода: Ultra набрал 3,86 из 5, а Thinking – 1,25. Модель выдумала метрику «bug rate = deployments / velocity» и сгенерировала полностью нерабочий скрипт.

Второй провал – анализ выручки. Стандартный режим верно посчитал $317 тыс., Thinking «додумался» до $236 тыс. – галлюцинация в промежуточных вычислениях.

Это не баг конкретной модели. Академические работы за 2025–2026 годы фиксируют один и тот же паттерн:

– Неверные ответы содержат вдвое больше thinking-токенов, чем верные – Короткие цепочки рассуждений до 35% точнее длинных – Корреляция между количеством токенов и точностью – отрицательная – Apple показал: для простых задач обычная модель работает лучше reasoning-модели

Где Thinking всё-таки помог – в задачах с множеством факторов: анализ стейкхолдеров, подготовка к переговорам, оценка рисков.

Вывод: режим рассуждений – не кнопка «думай лучше». Это инструмент для узкого класса задач, который вредит во всех остальных. Уметь различать – ключевой навык работы с AI.

Именно этому мы учим в Foundation-модуле курса – как понимать ограничения AI и использовать правильные инструменты для каждой задачи.

Полный разбор с данными и ссылками на исследования: mysummit.school/blog