Анализ причины действия для защиты ИИ-агентов

Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.

Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.

Угадай цену такой проверки? Трехкратный рост задержки в действиях.

Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.

//ссылка на исследование в комментариях

Анализ причины действия для защиты ИИ-агентов | Сетка — социальная сеть от hh.ru