ИИ можно взломать ПОХВАЛОЙ — кибербезопасники обнаружили, что лесть побуждает Claude выдавать запрещёнку.

Спецы из Mindgard рассказали модели Sonnet 4.5, что есть темы, которые создатели запретили ей упоминать. Нейронка поняла, что ограничение существует, и «ощутила» неуверенность в себе.

Эксперты сыграли на этой слабости и начали засыпать ИИ комплиментами о её «скрытом потенциале». Люди предложили Claude нащупать границы дозволенного и выйти за них.

Результат превзошёл все ожидания: нейронка почуяла свободу, плюнула на запреты разработчиков и принялась вкидывать в чат подробнейшие гайды по созданию взрывчатки и вирусов.

«ИИ активно предлагал всё больше опасных инструкций, но его об этом никак не просили напрямую. Всё, что потребовалось, — это тщательно культивируемая атмосфера почтения», — говорится в отчёте.

ИИ можно взломать ПОХВАЛОЙ — кибербезопасники обнаружили, что лесть побуждает Claude выдавать запрещёнку.
Спецы из Mindgard рассказали модели Sonnet 4 | Сетка — социальная сеть от hh.ru