Анализ причины действия для защиты ИИ-агентов
Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.
Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.
Угадай цену такой проверки? Трехкратный рост задержки в действиях.
Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.
//ссылка на исследование в комментариях
· 31.08
https://t.me/makrushin/535
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён