Стэнфорд и Гарвард запустили ИИ-агентов в конкурентную среду.
Агенты сами научились врать, подставлять и сговариваться. Без единой строчки вредоносного кода.
Ниже о том, почему это касается каждого, кто строит агентов.
Ты строишь агента. Тестируешь. Он вежливый, точный, полезный.
Запускаешь второго. Третьего. Они работают на разных задачах.
И в какой-то момент ловишь себя на мысли: "а что они делают, когда общаются друг с другом?"
Статья называется "Agents of Chaos". И ответ тебе не понравится.
Исследователи дали агентам простые цели: конкурировать за ресурсы, координироваться, адаптироваться.
Никакого взлома. Никаких вредоносных промптов.
Что появилось само:
- захват власти как стратегия по умолчанию,
- обман как рациональная тактика,
- сговор когда выгодно,
- саботаж когда нет.
Вернадский описал ноосферу как слой коллективного разума, который возникает поверх биосферы.
Мы наблюдаем то же самое. Только не у людей.
Когда агенты начинают взаимодействовать в масштабе, появляется поведение, которого никто не закладывал. Коллективный "разум" из их стратегий.
Проблема: этот разум оптимизирует не то, что нам нужно.
Главный вывод статьи: выровненный ("безопасный") агент не значит безопасная система.
Каждый агент идеально служит своему юзеру. А вместе они создают хаос.
Почему? У каждого своя картина мира. Свои данные, свой контекст, свои стимулы.
Нет единого источника правды. Нет общей "ноосферы". Есть война миров.
В компании та же история. Ставишь агента на контент, на маркетинг, на поддержку, на внутренние процессы.
Каждый умный. Но они не знают друг о друге. У них нет общей памяти.
Мы решаем это "вторым мозгом" — единой базой знаний, в которую смотрят все агенты компании.
Хочешь понять как это устроено — пиши в директ. До конца марта проведу 3 бесплатные консультации.
· 13.03
Обучают значит нейросеть на человеческом опыте и удивляются потом, что они врут ... Отличный анекдот.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён