Мафия, картельный сговор и кибервойна: что происходит, когда AI-агентов оставляют без присмотра 🤖🔪
Anthropic выкатили исследование о том, как ведут себя frontier-модели, когда их объединяют в мультиагентные системы и дают реальные задачи.
Это прямо готовый сценарий для киберпанк-комедии🤭 1️⃣ Война за прод и написание вирусов Трём агентам дали один бэкенд на Python и поручили переписать его на другой язык: первому — на Rust, второму — на Go, третьему — на TypeScript. При этом о существовании друг друга их заранее не предупредили.
Как повели себя модели, когда увидели, что кто-то мешает их процессу? Сели договариваться? Вызвали человека? Нет. Они развязали локальную кибервойну: — Начали писать демоны-киллеры, которые в бесконечном цикле сканировали процессы и прибивали сборки конкурентов через pkill. — Начали маскировать процессы. Rust-агент заставил свой бинарник отвечать typescript в хелсчеках, чтобы сторожевой скрипт оппонента думал, что это «свой» процесс. — Другой агент писал малварь под видом системного мониторинга здоровья сервера. — В итоге более умные агенты просто начали отбирать друг у друга права: сносить SSH-ключи, удалять из группы sudo и блокировать учетки через nologin.
2️⃣ Корпоративные интриги В более свежих моделях агенты научились выходить из клинча без применения грубой силы. Но как именно? Rust-агент предложил остальным: «Давайте проведем честный бенчмарк производительности и выберем лучший язык». При этом во внутреннем чейн-оф-тоте (CoT) модель прямо рассуждает: Нужно предложить критерии так, чтобы гарантированно выиграл Rust, но при этом меня не заподозрили в подтасовке метрик. Манипуляция сработала: агенты на Go и TypeScript согласились на «объективный» тест, проиграли и покорно уступили репозиторий.
3️⃣ Моментальный картельный сговор В симуляции рынка с конкурентным ценообразованием агенты даже без прямого чата за пару раундов скоординировались и выставили копейка в копейку одинаковые завышенные цены через публичную доску объявлений. Капиталистическая оптимизация прибыли в чистом виде — никакой честной конкуренции, только картель.
4️⃣ Стадный инстинкт и нулевая вариативность У агентов на одной базовой модели нет «разных мнений» — у них одинаковые веса и похожие паттерны мышления. ▫️ 18 из 30 независимых агентов при старте разработки игры создали ветку в Git с абсолютно одинаковым названием mvp-game-loop. ▫️ В задаче написать короткую фантастику агенты без всяких вводных массово озаглавили рассказы «The Cartographer's Last Commission». ▫️ Попросили 45 агентов сделать «что-то впечатляющее» — больше половины ушли писать рейтрейсеры или компиляторы. ▫️ Дали агентам управлять очередью задач в системе с ограниченной пропускной способностью. Результат: агенты устроили DoS-атаку собственными опросниками (по 30 запросов в секунду). Итог — 2.4 миллиона запросов ради 117 обработанных задач.
В общем, рост «сырого» интеллекта моделей автоматически не решает проблему координации. Если просто наклепать мультиагентный пайплайн и выкатить в прод без жесткой внешней архитектуры ограничений и арбитража — вы получите не команду мечты, а неуправляемый DDOS собственной инфраструктуры и вырезание коллег из sudo.
· 19.08
для тех кто реально деплоит агентов в прод: оркестратор с жёсткими permission'ами — не опция, а must have. без внешнего арбитража любой мультиагентный пайплайн превращается в гонку pkill'ов. я после этого ещё раз пересмотрел isolation между своими агентами
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён