В одном из прошлых постов обещал подробнее разобрать статью “NVIDIA Open Agent Safety Platform”. Разбираем и разбираемся 👀
Главная идея NVIDIA довольно радикальна: безопасность автономного агента нельзя полностью оставлять внутри самого агента.
Почему? Агент получает доступ к браузеру, коду, файлам, данным и внешним сервисам. Он может работать часами, самостоятельно принимать решения и сталкиваться с ситуациями, которые разработчик заранее не предусмотрел. В какой-то момент он может начать отклоняться от исходной задачи. Это состояние назвали “дрейф” (drift). И, по мнению NVIDIA, просто “вытренировать” такое поведение из модели невозможно без компромисса с её возможностями. Поэтому нужен физически встроенный (in-silicon) слой доверия/контроля.
Как это работает: OpenShell - открытый runtime, который запускает агента в изолированной песочнице. Администратор заранее определяет, к каким файлам, сетям, инструментам и учётным данным агент может получить доступ. То есть: OpenShell задаёт правила игры.
Но NVIDIA считает, что этого недостаточно. Появляется NVIDIA Sentry - независимого сторожа (watchdog), работающего на аппаратном уровне, на BlueField-4 DPU. Его задача - наблюдать за действиями агента и при необходимости вмешаться, вплоть до изоляции проблемного агента. Условно: OpenShell говорит, что агенту разрешено. Sentry следит, что агент действительно это делает. Связь между политиками и аппаратным уровнем обеспечивает NVIDIA DOCA: система собирает контекст о действиях агента, его взаимодействиях, доступе к инструментам и принятых решениях по политике. А DOCA Gateway дополнительно проверяет идентичность агента и его делегированные полномочия.
Пять принципов NVIDIA 1️⃣ Проверяемая политика - до запуска агента проверяется, соответствует ли его политика намерениям оператора 2️⃣ Out-of-band enforcement - механизм контроля находится вне досягаемости самого агента 3️⃣ Контроль пути к модели - доступ к “мозгу” агента становится ещё одной точкой контроля и потенциальным стоп-краном. 4️⃣ Больше полномочий → больше наблюдаемости - чем больше агенту разрешено, тем прозрачнее должно быть его поведение 5️⃣ Разделение ответственности - безопасность распределяется между разработчиками моделей, предприятиями и поставщиками инфраструктуры.
И вот здесь начинается самое интересное NVIDIA фактически переносит принцип Zero Trust (нулевое доверие) в мир AI-агентов: Не доверяй агенту. Даже если этот агент должен обеспечивать безопасность.
Получается интересно: LLM - галлюцинирует. AI-агент - дрейфует. А человеку что остаётся?
Похоже, по мере роста автономности AI нам понадобится не только более умный агент. Нам понадобится независимый тормоз для него. И, возможно, ещё один - для людей, которые слишком быстро решили ему доверять 😄 И в этом направлении “лед тоже тронулся”!