**Понимают ли LLM, когда ими манипулируют?

Я не знаю, как там** и что по науке, но факт в том, что наша с вами головешка очень даже анализирует в моменте времени огромное количество данных, что позволяет нам улавливать тонкости. Новое исследование из Принстона и Anthropic: «Are Large Language Models Sensitive to the Motives Behind Communication?» Ребата такие сели и решили понять: может ли ИИ отличить искренний совет от манипуляции? И ответ... не такой уж однозначный.

И я короче за вас прочитал и сделал выводы для себя. Вдруг, и вам понадобится.

Что проверяли? Учёные провели три серии экспериментов, где LLM нужно было отличать: 1️⃣ нейтральную информацию от намеренно «впариваемой» (как реклама), 2️⃣ совет друга, соседа или незнакомца - с разными личными выгодами, 3️⃣ реальные рекламные вставки с YouTube (NordVPN, AG1 и др.). Результаты шокируют - модели вроде GPT-4o и Claude 3.5 умеют немного отличать манипуляцию… но только в лабораторных условиях.

В реальных, «шумных» сценариях (например, спонсорская интеграция на YouTube) всё рушится: корреляция с рациональной моделью падает ниже 0.2.

Главный инсайт LLM пока не умеют по-настоящему читать намерения - они слишком послушны. Но если добавить в промпт простую фразу вроде “Обрати внимание на мотивы и выгоды говорящего”, результаты резко улучшаются! То есть модели могут быть бдительными, если их об этом прямо попросить. (и да, GPT-4o в этих тестах оказался самым «разумным»)

Почему это важно? 👉Если LLM не понимает мотивацию источника - она легко повторяет ложь, ведётся на манипуляции и делает «человеческие» ошибки. 👉🏼А теперь представьте это в корпоративном ассистенте, который читает внутренние отчёты или маркетинговые тексты… ИИ-ассистент, который помогает тебе в компании - читает отчёты, письма, маркетинговые тексты — учится на том же типе данных, что и LLM в эксперименте.

А эти данные всегда написаны людьми с мотивами. 👉🏻 Когда маркетинг пишет, что «новая фича - революция» - это не факт, а намерение повлиять. 👉🏻 Когда отчёт «всё зелёное по OKR» - это тоже коммуникация с мотивацией (удержать доверие руководства, не потерять бюджет и т.д.).

Если LLM не умеет видеть эти мотивы, она:

  • принимает пиар за правду,
  • усиливает внутренние искажения,
  • может давать советы, основанные на «манипулятивной» информации,
  • а потом менеджер, доверяя ассистенту, принимает решение на неверных основаниях.

То есть негатив в том, что ИИ без «внимательности к мотивам» становится ретранслятором корпоративного самообмана.

💬 Что это значит для нас? 👉🏼 В будущем «внимательность к мотивам» (motivational vigilance) станет новой метрикой качества ИИ, рядом с factuality, reasoning и alignment. 👉🏼 А промпт-дизайн, делающий мотивы источников явными, - ключ к надёжным агентам.

Ну если решите почитать сами, то вот вам отборнейших 40 страниц😉

Понимают ли LLM, когда ими манипулируют?
Я не знаю, как там и что по науке, но факт в том, что наша с вами головешка очень даже анализирует в моменте времени огромное количество данных, что позволяет ... | Сетка — социальная сеть от hh.ru Понимают ли LLM, когда ими манипулируют?
Я не знаю, как там и что по науке, но факт в том, что наша с вами головешка очень даже анализирует в моменте времени огромное количество данных, что позволяет ... | Сетка — социальная сеть от hh.ru