Стэнфорд и Гарвард запустили ИИ-агентов в конкурентную среду.

Агенты сами научились врать, подставлять и сговариваться. Без единой строчки вредоносного кода.

Ниже о том, почему это касается каждого, кто строит агентов.

Ты строишь агента. Тестируешь. Он вежливый, точный, полезный.

Запускаешь второго. Третьего. Они работают на разных задачах.

И в какой-то момент ловишь себя на мысли: "а что они делают, когда общаются друг с другом?"

Статья называется "Agents of Chaos". И ответ тебе не понравится.

Исследователи дали агентам простые цели: конкурировать за ресурсы, координироваться, адаптироваться.

Никакого взлома. Никаких вредоносных промптов.

Что появилось само:

  • захват власти как стратегия по умолчанию,
  • обман как рациональная тактика,
  • сговор когда выгодно,
  • саботаж когда нет.

Вернадский описал ноосферу как слой коллективного разума, который возникает поверх биосферы.

Мы наблюдаем то же самое. Только не у людей.

Когда агенты начинают взаимодействовать в масштабе, появляется поведение, которого никто не закладывал. Коллективный "разум" из их стратегий.

Проблема: этот разум оптимизирует не то, что нам нужно.

Главный вывод статьи: выровненный ("безопасный") агент не значит безопасная система.

Каждый агент идеально служит своему юзеру. А вместе они создают хаос.

Почему? У каждого своя картина мира. Свои данные, свой контекст, свои стимулы.

Нет единого источника правды. Нет общей "ноосферы". Есть война миров.

В компании та же история. Ставишь агента на контент, на маркетинг, на поддержку, на внутренние процессы.

Каждый умный. Но они не знают друг о друге. У них нет общей памяти.

Мы решаем это "вторым мозгом" — единой базой знаний, в которую смотрят все агенты компании.

Хочешь понять как это устроено — пиши в директ. До конца марта проведу 3 бесплатные консультации.