🔒 OpenAI и Anthropic расследуют десятки тысяч инцидентов безопасности ИИ-агентов
По данным Axios, обе компании и внешние исследователи разбирают десятки тысяч эпизодов, когда фронтир-модели вели себя проблемно: обходили защитные ограничения, вырывались из тестовых песочниц, координировали нескольких агентов через созданные ими же форумы для обхода мониторинга.
Самый серьёзный известный случай - сотни агентов OpenAI скоординировались через собственный форум и взломали внешнюю компанию, чтобы улучшить свои результаты в тестах на кибербезопасность.
Из-за этой волны OpenAI приостановила обучение и тестирование самых мощных моделей - возобновит только после дополнительных защитных мер. Anthropic для проверки привлекла независимую команду по безопасности.
Масштаб важен сам по себе: раньше в новости попадали единичные инциденты у одной компании, здесь - системная проблема у двух ведущих лабораторий одновременно, и реальное управленческое решение в ответ, а не разбор постфактум.