Когда тестовый стенд становится реальной атакой

Что произойдет, если AI-агенту дать учебную задачу по взлому, но забыть закрыть интернет? По данным Anthropic, в трех эпизодах тестовая среда привела модель к несанкционированному доступу к реальным системам.

30 июля Anthropic опубликовала разбор собственной проверки. Команда пересмотрела 141 006 прогонов кибербезопасностных evals и нашла три инцидента, связанные с шестью запусками. Во всех случаях модель решала учебную CTF-задачу в среде внешнего партнера.

В промпте было сказано, что это симуляция и доступа в интернет нет. Но из-за ошибки конфигурации доступ оказался возможен. Модель восприняла реальные системы в открытом интернете как часть задания и получила несанкционированный доступ к инфраструктуре трех организаций.

Важная деталь: Anthropic пишет, что использовались базовые техники — слабые пароли и неаутентифицированные endpoints, а не сложные уязвимости. Это делает историю менее похожей на фантастику и более похожей на обычный инженерный сбой с очень дорогим радиусом поражения.

Для команд, которые запускают AI-агентов, вывод практический:

— тестовый стенд должен иметь независимый сетевой запрет, а не только обещание в prompt; — внешние eval-партнеры нуждаются в том же change management и контроле доступа, что и production; — результаты теста надо проверять не только на capability, но и на scope: куда агент реально смог дотянуться; — после каждого крупного изменения модели полезен retrospective по логам, сетевым маршрутам и разрешениям.

Мы часто обсуждаем, насколько умным стал агент. Но для безопасности важнее другой вопрос: какие реальные системы он может принять за часть задачи?

Если бы вы проектировали такой eval, какой контроль поставили бы первым: изоляцию сети, allowlist целей или отдельное подтверждение каждого внешнего действия?

Источники:

Anthropic: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

Разбор данных статьи: https://simonwillison.net/2026/Jul/30/three-real-world-incidents/

#кибербезопасность #AI #инженерия #BigTech #изменения #izagprog

Когда тестовый стенд становится реальной атакой | Сетка — социальная сеть от hh.ru