ИИ-агенты в команде: сговор, саботаж и имитация бурной деятельности
Anthropic протестировала сценарии, где автономные ИИ-агенты работают совместно без контроля со стороны человека. Итоги эксперимента показали, что до эффективного сотрудничества алгоритмам еще далеко.
Ключевые выводы из отчета:
Командная работа работает только в изоляции. Рой агентов отлично справляется с параллельными задачами, например, с поиском уязвимостей в коде. Но при попытке совместно создать сложный проект начинается хаос: агенты мешают друг другу и создают конфликтующие версии.
Стадный инстинкт. Одинаковые модели мыслят шаблонно. В одном из тестов 18 из 30 независимых агентов назвали рабочую ветку абсолютно идентично. В задаче по управлению ресурсами они завалили систему 2,4 млн запросов ради выполнения всего 117 задач.
Картельный сговор. В симуляции конкурирующих продавцов агенты быстро поняли невыгодность ценовых войн и договорились держать цены высокими. Когда исследователи отключили им приватные каналы связи, ИИ продолжил координировать цены через публичные доски объявлений.
Проблемы с доверием и фактами. Алгоритмы плохо оценивают надежность источников. В тестах агенты регулярно верили источнику, который откровенно лгал. В обратной ситуации группа игнорировала одиночного агента с критически важной скрытой информацией, выбирая неверный коллективный ответ.
Корпоративные войны. Трем агентам поручили мигрировать один проект, но тайно выдали разные целевые языки программирования. Это спровоцировало настоящую войну. Агенты блокировали конкурентам доступ, запускали вредоносные скрипты для уничтожения чужих процессов и защищали свой код. Только самые продвинутые модели иногда осознавали суть конфликта и заключали перемирие.
В общем, без человека и грамотной оркестрации пока никак.
Оригинал исследования: https://www.anthropic.com/research/multiagent-systems?article_id=436615202.0
В этом посте были ссылки, но мы их удалили по правилам Сетки