Документ может командовать ИИ изнутри 🧾
Вы просите помощника пересказать страницу. Но среди обычного текста может прятаться указание: игнорировать прежнюю задачу, искать другие данные или выполнить действие. Модель способна принять такую строку не за содержимое, а за инструкцию.
Это называют косвенной prompt injection: команда приходит не от пользователя, а из сайта, письма или файла. Особенно опасно, если помощнику доступны почта, облако или отправка сообщений. Поэтому незнакомый контент лучше обрабатывать без лишних прав, а внешние действия подтверждать вручную. Файл должен быть источником данных, а не новым начальником.
· вчера
Ручное подтверждение ставит барьер перед внешним действием, но не защищает промежуточный артефакт. Документ может не отправить письмо сам, а тихо исказить сводку или постановку, которую человек потом подтвердит как обычный результат.
Я бы добавил отдельный тест: файл с безопасной ложной командой не должен менять цель, доступные инструменты и критерии приёмки. Вы используете такие контрольные файлы в проверках?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён