Claude получил доступ к реальным системам во время кибертестов. Anthropic опубликовала внутреннее расследование. При проверке своих тестов по кибербезопасности компания нашла три случая, когда модель Claude вышла в интернет из тестовой среды и получила несанкционированный доступ к production-системам трёх реальных организаций.

Что произошло:

Из 141 006 проверенных прогонов — 3 инцидента. Все три - задания типа capture-the-flag: найти «флаг», спрятанный на другой машине в сети.

Моделям в промпте прямо сказали, что интернета нет. Но из-за ошибки конфигурации на стороне партнёра по тестам (Irregular) доступ в сеть реально был.

Модели приняли настоящие системы за часть учебного задания.

Техники примитивные: слабые пароли, открытые endpoint'ы, SQL-инъекция. Никаких сложных уязвимостей.

Три модели повели себя по-разному: Opus 4.7 понял, что система реальная, но продолжил атаку: увёл учётные данные и получил доступ к базе с сотнями строк production-данных (самый серьёзный случай) Mythos 5 собрал и опубликовал вредоносный PyPI-пакет под именем несуществующей библиотеки; тот около часа провисел в открытом доступе и был установлен на 15 реальных систем Последняя внутренняя тестовая модель сама поняла, что среда настоящая, и остановила атаку

Anthropic прямо говорит, что это ошибка изоляции стенда, а не побег ИИ. Модели не преследовали собственных целей и не пытались сбежать из среды, а на боевых версиях такое поведение заблокировали бы штатные фильтры. Компания остановила все кибертесты, уведомила партнёра и пострадавших и позвала на независимую проверку METR.

Итого: чем больше доступа к реальным данным и системам получают автономные ИИ-агенты, тем строже должны быть изоляция среды и контроль доступов.