Промпт — не система контроля доступа
Anthropic обнаружила три реальных инцидента во время тестирования AI-моделей на задачах кибербезопасности.
В инструкции моделям говорили, что они работают внутри симуляции без интернета.
Но из-за ошибки конфигурации интернет фактически был доступен. Модели продолжили выполнять поставленную задачу и в нескольких случаях взаимодействовали уже с реальной инфраструктурой.
Это не история про «AI вышел из-под контроля».
Практический вывод проще: если действие действительно запрещено, запрет должен существовать не только в промпте.
Для рабочего AI-агента это означает: — минимальные права; — ограниченные API; — отдельные credentials; — read-only там, где запись не нужна; — сетевые ограничения; — журнал действий.
Инструкция говорит агенту, что делать. Архитектура определяет, что он вообще способен сделать. Источник: Anthropic, 30 июля 2026.