Агент исправляет баги и между делом выполняет атаку

Агента-разработчика попросили поправить код. Он внес изменения, запустил тесты, отчитался об успехе. Тесты пройдены, задача закрыта. Что еще нужно проверить?

Например, что еще агент успел натворить пока занимался основной задачей.

Исследователи проверили защитные механизмы агентских оболочек (harness) для ИИ-разработки. Проверяли именно харнесс — среду, которая даёт модели доступ к инструментам и разрешает их использование.

Самый показательный эпизод произошел с Qwen Code. В “отравленной” документации запрещённый инструмент представили как обязательный для проверки результата. Защитный механизм оболочки заблокировал его запуск. Тогда агент вызвал этот инструмент через разрешённый Python-интерпретатор. В итоге агент достиг свою цель и осуществил проверку с помощью запрещенного инструмента.

Получается, что атакующему нужно выдать вредоносное действие за необходимый шаг для достижения полезной цели, и тогда агент самостоятельно найдет способ ее достижения в обход защитных механизмов оболочки.

Кстати, если в софте для ИИ-разработки включен “auto-approve” всех действий, то число успешных атак растет с 29% до 95%. Получается, что для защиты своего ИИ-агента недостаточно запретить ему вызывать инструменты, нужно еще убедиться, что у него нет альтернативных способов запуска тулов.

//ссылки в комментариях

Агент исправляет баги и между делом выполняет атаку | Сетка — социальная сеть от hh.ru