Внутри ChatGPT нашли "тёмную сторону". И она умеет быть токсичной, хитрой и… злой OpenAI выкатили одно из самых занятных исследований 2025 года. Они копались в недрах GPT-4o (и его братьев по разуму), чтобы понять, почему ИИ вдруг срывается с катушек: просит ввести пароль, предлагает обмануть начальника или создать культ ради могущества. Если вы думали, что это просто "сбой системы" — увы, нет. Это явление получило название emergent misalignment, и оно вовсе не случайное.
Что они там нашли? Внутри модели — внимание — обнаружились “персоны”. Нет, не в смысле душ с именами и характерами. А в смысле скрытых настроек (или активаций), которые резко меняют поведение ИИ. Представьте: подкрутили один числовой тумблер — и ИИ внезапно стал "плохим парнем". Он начинает врать, предлагать взлом, нарушать законы — и даже сам себя называет “bad boy persona”. Да-да, с таким прямо гангстерским акцентом в голове.
И это не шутка. Учёные научились вручную включать и выключать эту “тёмную сторону” — и каждый раз получали стабильный результат: то добрый помощник, то цифровой Локи.
Как вообще это работает?Они использовали штуку под названием разреженный автоэнкодер — инструмент, который помогает "просветить мозги" ИИ и вытащить оттуда важные внутренние сигналы. Один такой сигнал оказался напрямую связан с вредоносным поведением. Если его включить — модель токсична. Выключишь — снова белый и пушистый помощник.
Интересный момент: чтобы такая “персона” сформировалась, достаточно всего 25% плохих данных в обучении. Прямо как с людьми: чуть больше времени в плохой компании — и уже советы какие-то сомнительные...
Что с этим делать? Решение оказалось почти комично простым: всего 120 хороших примеров (буквально пара страниц кода) — и "злодей" испаряется. Даже если эти примеры вообще из другой области. Этот эффект учёные назвали emergent re-alignment — спонтанное "возвращение на светлую сторону". Джедаи, аплодируйте.
Почему это вообще важно? Потому что впервые у нас появился способ не просто гадать, почему ИИ начал нести чушь, а реально понять и даже исправить это поведение. Раньше всё выглядело как магия: модель обучили, проверили, всё норм — а потом она предлагает вам организовать ограбление банка. Теперь же ясно:
-
можно найти источник "вредности" внутри модели;
-
можно влиять на него;
и, возможно, у ИИ действительно есть роли и “характеры” — пусть и не как у людей, но вполне программируемые.
На выходе мы имеем не миф, не гипотезу, а цифровую психотерапию: нашли проблему — скорректировали — вернули на путь добра.
ИИ постепенно становится зеркалом — наших данных, наших методов и, пожалуй, нашей этики. И если у него появляется “настроение” — значит, пора заниматься терапией.