Промпт — не система контроля доступа

Anthropic обнаружила три реальных инцидента во время тестирования AI-моделей на задачах кибербезопасности.

В инструкции моделям говорили, что они работают внутри симуляции без интернета.

Но из-за ошибки конфигурации интернет фактически был доступен. Модели продолжили выполнять поставленную задачу и в нескольких случаях взаимодействовали уже с реальной инфраструктурой.

Это не история про «AI вышел из-под контроля».

Практический вывод проще: если действие действительно запрещено, запрет должен существовать не только в промпте.

Для рабочего AI-агента это означает: — минимальные права; — ограниченные API; — отдельные credentials; — read-only там, где запись не нужна; — сетевые ограничения; — журнал действий.

Инструкция говорит агенту, что делать. Архитектура определяет, что он вообще способен сделать. Источник: Anthropic, 30 июля 2026.