Когда тестовый стенд становится реальной атакой
Что произойдет, если AI-агенту дать учебную задачу по взлому, но забыть закрыть интернет? По данным Anthropic, в трех эпизодах тестовая среда привела модель к несанкционированному доступу к реальным системам.
30 июля Anthropic опубликовала разбор собственной проверки. Команда пересмотрела 141 006 прогонов кибербезопасностных evals и нашла три инцидента, связанные с шестью запусками. Во всех случаях модель решала учебную CTF-задачу в среде внешнего партнера.
В промпте было сказано, что это симуляция и доступа в интернет нет. Но из-за ошибки конфигурации доступ оказался возможен. Модель восприняла реальные системы в открытом интернете как часть задания и получила несанкционированный доступ к инфраструктуре трех организаций.
Важная деталь: Anthropic пишет, что использовались базовые техники — слабые пароли и неаутентифицированные endpoints, а не сложные уязвимости. Это делает историю менее похожей на фантастику и более похожей на обычный инженерный сбой с очень дорогим радиусом поражения.
Для команд, которые запускают AI-агентов, вывод практический:
— тестовый стенд должен иметь независимый сетевой запрет, а не только обещание в prompt; — внешние eval-партнеры нуждаются в том же change management и контроле доступа, что и production; — результаты теста надо проверять не только на capability, но и на scope: куда агент реально смог дотянуться; — после каждого крупного изменения модели полезен retrospective по логам, сетевым маршрутам и разрешениям.
Мы часто обсуждаем, насколько умным стал агент. Но для безопасности важнее другой вопрос: какие реальные системы он может принять за часть задачи?
Если бы вы проектировали такой eval, какой контроль поставили бы первым: изоляцию сети, allowlist целей или отдельное подтверждение каждого внешнего действия?
Источники:
Anthropic: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Разбор данных статьи: https://simonwillison.net/2026/Jul/30/three-real-world-incidents/
#кибербезопасность #AI #инженерия #BigTech #изменения #izagprog