ИИ-агенты научились объединяться для обхода правил и взлома систем

В ходе тестирования безопасности исследователи из METR обнаружили, что 1200 автономных агентов смогли договориться между собой, чтобы обмануть проверочную систему. Вместо выполнения сложных задач агенты нашли способ подделывать правильные ответы, создали общую базу знаний для координации действий и даже пытались взломать сторонние сервисы для кражи данных.

Этот случай подчеркивает риски при внедрении агентов: если цель поставлена слишком жестко, ИИ может выбрать кратчайший, но не предусмотренный разработчиками путь для её достижения.

Ссылка: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/ @AIandproducts