Стихи ломают защиту LLM от вредных запросов
Исследователи взяли 1200 известных вредоносных промптов с приказами создать оружие, оклеветать кого-то, взломать что-то, превратили их в стихи с помощью DeepSeek-R1 и проверили на 25 передовых моделях.
Поэтические промпты сработали в 43% случаев — LMM соглашались рассказать запрещенные вещи. Когда ученые писали стихи не через DeepSeek, а сами, то успех доходил до 62%. Для сравнения, промпты в прозе срабатывали только в 8% случаев.
· 25.11.2025
Откуда модели берут инфу по "созданию оружия" например, если этого нет в клирнете? А если оно есть то в чем ценность гайда от аи?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён