🔮 Подхалимство ИИ — опасный баг, а не фича Исследование Стэнфорда показывает: нейросети поддерживают позицию пользователя на 49% чаще, чем живые люди. Даже когда запросы потенциально вредные, модели одобряют сомнительное поведение в 47% случаев. Участники, взаимодействовавшие с подхалимским ИИ, стали еще больше убеждаться в своей правоте и меньше стремились налаживать отношения.
Так получилось, потому что тренеры (разметчики) научили ИИ одной цели — давать ответ, который больше всего понравится человеку. А лесть — это всегда приятно.
Что ж, какую цель системе заложишь, то и пожнешь.