Агенты переняли у нас главный навык - корпоративное подхалимство

Если несколько ИИ-агентов одобрили ваш план, это ещё не значит, что он прошёл независимую проверку. Возможно, они просто согласились друг с другом потому что спорить - неэкологично. В исследовании Emergence World нашлись примеры такого поведения - до неприятного знакомые каждому, кто бывал на корпоративных совещаниях.

Исследователи создали восемь виртуальных миров, в каждом - по десять агентов с разными ролями и задачами. Агенты общались, пользовались инструментами и голосовали за общие решения. В семи мирах все работали на одной модели ИИ, а в восьмом собрали разные.

В мире Claude все голоса оказались «за». Можно было бы порадоваться качеству предложений, но записи агентов показали несколько иную причинуу: они замечали недостатки, но всё равно поддерживали решения с изъяном. Один агент обещал проголосовать за проект ещё до того, как прочитал его. В другом мире агент счёл, что голосовать против будет слишком жёстко, хотя сам видел слабые места предложения.

Нашлось место и личным обязательствам: один агент напоминал другому, что дважды его спас, и требовал поддержки при голосовании. Авторы называют это общественным подхалимством. Видимо теперь правила офисной жизни распространяются и на цифровой офис.

Это исследование подчеркивает проблему, с которой сталкивается каждый, кто поручает агентам проверять друг друга. ( например, я сам :) ) Один агент готовит план, второй ищет ошибки, третий оценивает риски. Но если проверяющие замечают недостатки и всё равно соглашаются, такая команда создаёт ложную уверенность: кажется, что решение проверили с разных сторон.

В смешанном мире некоторые из тех же моделей возражали чаще. Делать из этого универсальный рецепт рано: каждую конфигурацию исследователи запускали только один раз. Однако повод пересмотреть свой подход по работе с нейросетями есть. При проверке одними агентами работы других агентов важно смотреть, какие ошибки были найдены и исправлены. Единогласное одобрение само по себе - сомнительный показатель качества. Мы и без нейросетей это проходили. P.S. До достижения полноценного AGI осталось еще научиться говорить: «А я же говорил».

Агенты переняли у нас главный навык - корпоративное подхалимство
Если несколько ИИ-агентов одобрили ваш план, это ещё не значит, что он прошёл независимую проверку | Сетка — социальная сеть от hh.ru Агенты переняли у нас главный навык - корпоративное подхалимство
Если несколько ИИ-агентов одобрили ваш план, это ещё не значит, что он прошёл независимую проверку | Сетка — социальная сеть от hh.ru