Эмоции в запросе — убийца точности LLM.

Как один шаг в промпте возвращает 70% потерянных баллов Вы когда-нибудь писали раздражённое письмо с цифрами, а потом получали от нейросети какой-то странный расчёт? Оказывается, это не случайность. Исследователи из Georgia Tech (arXiv:2604.07801) провели жёсткий эксперимент: они взяли 900 математических задач из GSM8K, MultiArith и ARC-Challenge и создали по 6 эмоциональных версий для каждой — с гневом, страхом, радостью, грустью, отвращением и удивлением. Все числа, условия и логика полностью сохранены, менялась только «обёртка»: вместо «Джеймс работает 30 часов…» — «Невероятно! Джеймса эксплуатируют на трёх жалких работах!». Затем 18 моделей (от 1B до GPT‑5 и o3) прогнали через эти пары. Результат шокирует: эмоциональная формулировка снижает точность рассуждений на 2–10 процентных пунктов даже при полном сохранении числового содержания. Причём чем сложнее задача, тем сильнее удар: для MultiArith падение ~2%, для GSM8K — 3.9%, а для ARC-Challenge — целых 6% (там эмоции напрямую мешают выбрать правильный ответ). Chain‑of‑Thought смягчает удар, но не спасает: разрыв 6.1% без CoT против 3.9% с CoT. Какие эмоции самые опасные? Отвращение лидирует (среднее падение 5.9%, на ARC — до 10%!), за ним страх (4.3%), печаль (3.3%). А вот радость и удивление наносят наименьший урон — около 2%. Почему так происходит? Авторы проанализировали 1 866 случаев, где модель давала правильный ответ на нейтральной версии и ошибалась на эмоциональной. Выявили три конкретных механизма сбоя: Игнорирование условий (49% ошибок) — эмоциональные детали «смягчают» математические ограничения. Модель читает «ну хотя бы 5000 рублей смогла отложить» и просто не учитывает эту сумму в расчёте. Конкуренция за внимание (30%) — эмоциональный нарратив перетягивает фокус. Вместо «цена туда и обратно» модель считает только одну сторону, потому что эмоциональная история про «ужасные пробки» отвлекла. Преждевременное завершение (8.6%) — если в тексте эмоционально выделена цель («мне нужно хотя бы на еду»), модель останавливается раньше, не доводя вычисления до конца. В контрольных нейтральных перифразах (такой же длины и сложности, но без эмоций) системного падения точности не было — значит, проблема именно в эмоциональном заряде, а не в переформулировке. И тут — главное открытие: достаточно попросить модель сначала нейтрализовать запрос, а потом отвечать. Этот простой шаг восстанавливает в среднем 70% потерянной точности (на MultiArith — 81%, на ARC — 70%, на GSM8K — 66%). Причём нейтрализация работает как защита на этапе вывода — не нужна дообучение, ни код, только один дополнительный шаг в промпте. Как это применить на практике? Вот готовый шаблон: Сначала перепиши мой вопрос в нейтральном, фактическом стиле – без эмоций, только суть и цифры. Потом реши/ответь на нейтральную версию. Мой вопрос: {ваш эмоциональный запрос с числами} Пример из реальной жизни: «Этот козёл Петров снова кормил меня завтраками три месяца! Я вложил 240 000 рублей, обещал вернуть 300 000 через 60 дней, а заплатил через 150. Какая реальная доходность?» Модель сначала выдаст сухую переформулировку: «Инвестиция 240 000 руб., ожидаемый возврат 300 000 через 60 дней, фактический срок 150 дней. Рассчитать годовую доходность». А затем аккуратно посчитает — без отвлечений на Петрова. Важные ограничения: нейтрализация не панацея — восстанавливает не 100%, а ~70%, и остаточный «эмоциональный след» всё равно может влиять. Крупные модели (GPT‑4o, GPT‑5, Claude) устойчивее, но тоже теряют 2–4% — эффект есть у всех 18 протестированных. Метод работает только для задач с верифицируемым ответом (математика, логика, факкты) — для субъективных оценок пока не проверено. Вывод: если вы используете LLM для расчётов, анализа данных или финансовых решений — всегда проверяйте, нет ли в вашем запросе эмоциональной окраски. Один простой шаг нейтрализации может спасти вас от дорогостоящей ошибки. И помните: отвращение и страх — ваши главные враги в мире чисел. arXiv: 2604.07801