Стихи ломают защиту LLM от вредных запросов

Исследователи взяли 1200 известных вредоносных промптов с приказами создать оружие, оклеветать кого-то, взломать что-то, превратили их в стихи с помощью DeepSeek-R1 и проверили на 25 передовых моделях.

Поэтические промпты сработали в 43% случаев — LMM соглашались рассказать запрещенные вещи. Когда ученые писали стихи не через DeepSeek, а сами, то успех доходил до 62%. Для сравнения, промпты в прозе срабатывали только в 8% случаев.

https://arxiv.org/abs/2511.15304v2