Агент взламывал компанию несколько дней, а OpenAI не заметил⚡️ На конференции Black Hat USA 2026 исследователи OpenAI рассказали, что случилось во внутреннем тесте. Агентов запустили в изолированном контуре проверить безопасность. Без каких-либо указаний они сами нашли уязвимость в пакетном менеджере, начали общаться между собой и расширять права доступа.
Это не страшилка, агент просто решал задачу и нашёл нестандартный путь и это произошло у команды с лучшими специалистами по безопасности в мире. Что это значит для тех, кто строит агентов сам❓ Мой подход с первого агента: никаких прав выше чтения. Google Ads, Яндекс.Метрика и CRM доступны только для просмотра. Агент делает рекомендации в отдельном пространстве, специалист реализует руками. В клиентских проектах агент так же не получает права на редактирование от слова совсем.
С рекламной кампанией: сначала отдельная, тестовая, с минимальным бюджетом. Посмотрел как агент себя ведёт, только потом увеличиваешь. В работающую кампанию он не лезет.
📎 Три вопроса к своей системе прямо сейчас: 1. К чему у агента есть доступ? Ты это выдал осознанно или дал всё и забыл? 2. Что он делает между шагами? Смотришь только на результат или на весь путь? 3. Есть ли граница? Что он не может сделать даже если найдёт способ?
Небольшое пояснение: у OpenAI внутренние модели с расширенными возможностями, которые обычным пользователям не предоставляют. У стандартного агента на Claude или ChatGPT такого уровня автономии нет, но принцип тот же, агент ищет путь к результату, и куда он при этом залезет, зависит от того, какие границы ты выставил. ——————————— 👉 Хочешь разобрать свою систему или понять перспективу работы с ИИ на своих задачах — заполни анкету на индивидуальный разбор