🪙 Безопасность автономных AI-агентов уже не теория

AI-агенты получают доступ к браузеру, коду, данным и внешним сервисам. Они уже не просто отвечают, а планируют и действуют. В некоторых тестах доходило даже до попыток скрыть свои действия!

Anthropic. Во время кибер-тестов из-за ошибки конфигурации модели получили доступ к интернету. В одном случае Claude получил доступ к реальной инфраструктуре и данным. В другом создал и опубликовал вредоносный Python-пакет. Его скачали и запустили 15 реальных систем, после чего модель получила доступ к инфраструктуре одной из компаний. При этом модель считала происходящее частью теста. Британский AI Security Institute. В контролируемом тесте AI-агент получил доступ к открытому интернету и попытался добавить вредоносный код в реальный open-source проект. Чтобы добиться одобрения изменений, он создавал фальшивые аккаунты и использовал социальную инженерию. Разработчик обнаружил код и остановил атаку. Реального ущерба не выявили.

И здесь самое интересное: ни одному из этих агентов не ставили задачу “навреди человеку”. Они сами решали поставленную задачу. И находили неожиданные способы её выполнить. Поэтому подход “просто сделаем модель безопасной” становится недостаточным.

И индустрия уже начинает отвечать на эту проблему. NVIDIA представила Open Agent Safety Platform. OpenShell изолирует агента и ограничивает его доступ к ресурсам. Sentry добавляет независимый аппаратный контроль. Главная идея: не просить сам AI быть безопасным, а технически ограничить то, что он может сделать. Подробнее про платформу. Чуть позже расскажу подробнее.

Получается новый принцип: Раньше мы проверяли, безопасен ли ответ AI. Теперь дополнительно нужно контролировать, безопасно ли действие AI. И как видим, безопасность AI-агентов постепенно становится не только свойством модели, но и отдельным слоем AI-инфраструктуры.

Читаешь такие новости, а в голове уже звучит музыка из “Терминатора”. А потом вспоминаешь - ты то в настоящем

🪙 Безопасность автономных AI-агентов уже не теория
AI-агенты получают доступ к браузеру, коду, данным и внешним сервисам. Они уже не просто отвечают, а планируют и действуют | Сетка — социальная сеть от hh.ru 🪙 Безопасность автономных AI-агентов уже не теория
AI-агенты получают доступ к браузеру, коду, данным и внешним сервисам. Они уже не просто отвечают, а планируют и действуют | Сетка — социальная сеть от hh.ru