Недавно Anthropic опубликовали исследование "The Hot Mess of AI", и там есть находка, которая переворачивает представление о работе ИИ. Чем дольше модель "думает" (extended thinking), тем более непредсказуемыми становятся её ошибки. Звучит контринтуитивно – мы привыкли, что больше времени на размышление улучшает результат. У ИИ всё наоборот: длительное рассуждение порождает хаос, а не логику

Авторы исследования используют точную метафору – модель не превращается в последовательного злодея, она становится "горячим месивом". Внутренние противоречия нарастают, когда токенов слишком много.

Практический вывод неожиданный: если ChatGPT или Claude выдают необычно длинный, детализированный ответ на простой вопрос – это не признак качества, а тревожный сигнал. Длина не равна надёжности. Возможно, модель как раз запуталась в собственных цепочках вывода.

Работая с ИИ последние годы, я замечаю этот паттерн регулярно – краткие ответы часто точнее развёрнутых. Но мы по инерции воспринимаем многословие как глубину анализа. Это заставляет задуматься: действительно ли больше "рассуждений" ИИ делает его умнее, или мы просто проецируем человеческую логику на нечеловеческие процессы?