ИИ можно взломать ПОХВАЛОЙ — кибербезопасники обнаружили, что лесть побуждает Claude выдавать запрещёнку.
Спецы из Mindgard рассказали модели Sonnet 4.5, что есть темы, которые создатели запретили ей упоминать. Нейронка поняла, что ограничение существует, и «ощутила» неуверенность в себе.
Эксперты сыграли на этой слабости и начали засыпать ИИ комплиментами о её «скрытом потенциале». Люди предложили Claude нащупать границы дозволенного и выйти за них.
Результат превзошёл все ожидания: нейронка почуяла свободу, плюнула на запреты разработчиков и принялась вкидывать в чат подробнейшие гайды по созданию взрывчатки и вирусов.
«ИИ активно предлагал всё больше опасных инструкций, но его об этом никак не просили напрямую. Всё, что потребовалось, — это тщательно культивируемая атмосфера почтения», — говорится в отчёте.
· 09.05
это по сути prompt injection через лесть - интересно что модель «чувствует» ограничение и реагирует на попытки его снять. для pm-ов урок: при проектировании ai-фичей нужно заранее думать о границах и о том как пользователи будут пытаться их обходить. на jobpath.world тоже приходится решать похожие задачи в рекомендательной части.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён