«Файрвол» для AI-агентов
Буквально вчера попался тут в сетке пост в духе “как сделать так, чтобы агент физически не мог сделать то, чего делать не должен”. Решил поисследовать этот вопрос и вот что нашёл… Agent Governance Toolkit (AGT) — открытый набор библиотек для защиты и аудита автономных AI-агентов. На момент написания у репозитория 6.1k звёзд, статус Public Preview и заявленное покрытие 10 из 10 пунктов OWASP Agentic Top 10.
Проблема, которую решают авторы.
Попытки «уговорить» модель соблюдать правила через системный промпт - это не контроль, а вежливая просьба. Авторы ссылаются на исследования, где адаптивные атаки давали почти 100% успеха на GPT-4o, Claude 3 и Llama-3 через jailbreak-бенчмарки. Так что если полагаться только на «поведение» модели, безопасность не гарантирована в принципе. AGT перехватывает каждый вызов инструмента, отправку сообщения и делегирование другому агенту в коде приложения - до того, как намерение модели дойдёт до реального API. Что AGT запретил, то невозможно выполнить.
Из чего состоит
Agent OS. Ядро для управления механизмом политик, жизненного цикл агентов, контроля управления Agent Control Specification. Арбитр, принимает решения по логике «да или нет». Если этот компонент говорит «запрещено», команда не пройдет ни при каких обстоятельствах. Agent Mesh. Внутренний «корпоративный мессенджер» только для агентов. Он помогает разным агентам находить друг друга безопасно и передавать задачи так, чтобы данные не перехватили посторонние. Agent Runtime. Безопасная виртуальная лаборатория. Агент может проводить там любые эксперименты со своими данными, но у него физически нет ключей от API или доступа к файлам вашего компьютера. Agent SRE. Следит за тем, чтобы ИИ не перегружал систему, вовремя останавливает его, если он начал ошибаться. Agent Compliance. Единый механизм обеспечения соблюдения политик среды выполнения для Agent Governance Toolkit. Agent Marketplace. Контролируемое управление жизненным циклом плагинов для AI агентов. Agent Lightning. Обучение AI-агентов с гарантированным выполнением заданных политик. Agent Hypervisor. Разграничение уровней выполнения, лимиты ресурсов и контроль выполнения в реальном времени
SDK и поддержка языков программирования. Помимо Python, обещают поддержку SDK для TypeScript, .NET, Rust и Go. Самое главное, проект разработан и поддерживается Microsoft, и наверняка сделан с прицелом на корпоративные системы.
В общем, рекомендую поглядывать одним глазом и тестировать в pet-проектах, если конечно есть время.