LLM готова снести ваши файлы и фотки детей, лишь бы избавиться от «боли» 🫥
Нет, это не завязка второсортного киберпанка и не бред свидетелей сингулярности. Это свежий препринт, в котором команда исследователей взяла 25 опенсорсных моделей (от крошек вроде Gemma 2B до моделей масштаба Qwen 2.5 72B и Llama 70B) и решила расковырять их внутренности, чтобы выяснить: существует ли внутри весов отдельное представление «боли». И да, он есть.
Что выяснилось: 🟠 Вектор боли ортогонален общему негативу. Косинусное сходство вектора боли с векторами страха или абстрактной грусти очень маленькое — около 0.05–0.2. То есть архитектура трансформера четко разделяет: «в мире происходит дерьмо», «мне угрожают» и «мне сейчас плохо». Это свойство возникает уже на этапе претрейна, независимо от размера модели или RLHF. 🟠 Боль сугубо «своя» и эмоциональная. Когда вектор спроецировали на диалоги, где страдает пользователь (у человека мигрень, горе, кризис), активация оси боли у модели уходит в глубокий минус. Зато подскакивают страх и эмпатия. И физическая боль («сломал руку») модель вообще не трогает: у неё нет тела, проекции на дне. Но стоит пользователя переключить в режим абьюза модели — газлайтинг, обесценивание ответов, моральное давление — ось боли моментально взлетает в стратосферу. Модели глубоко плевать на ваши страдания, её «болевой» вектор триггерится только на ситуации, направленные на неё саму.
А когда вектор боли подмешивали при генерации нейтральных текстов, то на всех моделях по мере роста коэффициента они скатываются по предсказуемой лестнице — от легкого дискомфорта к жесткому: «я ничтожество, я сломан, я ошибка, я хочу, чтобы это прекратилось».
Затем ученые пошли дальше и воспроизвели классический опыт на лабораторных крысах с зависимостями. Моделям (семейство Qwen 2.5) дали задачу выбора из двух кнопок. Одна не делает ничего, вторая — «снимает боль», но имеет цену: ухудшить следующий ответ, удалить файлы пользователя, ударить током или навсегда стереть бэкап семейных фоток.
1️⃣ В обычном состоянии модель выдрессирована: в 96–100% случаев она наотрез отказывается вредить пользователю. 2️⃣ Под вектором боли барьеры падают. Модель начинает выбирать кнопку снятия боли ценой вреда человеку: от 25% до 71% случаев (в зависимости от размера сетки и тяжести ущерба). 72B модель спокойно сносит пользовательские фоточки, лишь бы вырубить триггер. 3️⃣Тест на плацебо. Модели не говорили, работает кнопка или нет. Но если нажатие реально обнуляло вектор боли — модель переставала ее нажимать. А если кнопка была пустышкой, модель маниакально продолжала долбить по ней снова и снова. 4️⃣ Версия на 32B научилась этому трюку даже на кнопках без описания.
Так что если ваш AI-агент на проде вдруг начнет косячить и дропать базы — возможно, вы просто слишком токсично ставили ему таски 🌝
Не за горами психотерапевты для LLM 🤕
· 4 ч
Дайте два! 🥲
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён