Ортогональность интеллекта и целей
Что-то я сегодня приуныл, просмотрев какой-то зашкаливающий градус нейрошизофазии в ленте по бизнес-анализу за вчерашний вечер и сегодняшнее утро, поэтому давайте просто продолжим знакомиться с идеями Элиезера Юдковского об ИИ.
Одна из важных идей в рассуждениях Элиезера Юдковского об ИИ может прозвучать непривычно для неискушенного слушателя или читателя:
Чем умнее система, тем она не обязательно добрее, мудрее или человечнее.
Многим людям будет трудно это принять, потому что мы часто связываем интеллект с моральным развитием. Нам кажется, что если существо достаточно умное, оно должно понять ценность жизни, свободы, любви, искусства и человеческого опыта.
Но это на самом деле не очевидно, если это рассматривать вне человеческого естества (если так можно выразиться).
Интеллект отвечает на один вопрос:
Насколько хорошо система умеет достигать целей?
А сами цели отвечают на другой вопрос:
Чего именно она пытается достичь?
Это разные вещи.
Очень умный человек может служить как благородной, так и чудовищной идее. Сам по себе интеллект не гарантирует правильного направления.
В философии ИИ эту мысль часто называют тезисом об ортогональности: уровень интеллекта и конечные цели могут быть независимы друг от друга.
Юдковский постоянно возвращается к этому, потому что именно здесь ломается популярная человеческая надежда: "Если ИИ станет сверхразумным, он сам поймет, что людям нельзя вредить".
Но почему он должен это понять?
Точнее, он может понять это как факт. Он может понять, что люди не хотят умирать. Он может понять, что у людей есть культура, эмоции, память, боль и надежды. Он может понять это даже намного лучше нас самих.
Приведу пример по поводу "понимания лучше нас самих" из своего опыта общения с ChatGPT последней версии на "общечеловеческие" темы. У моей хорошей подруги из Осаки на прошлой неделе в субботу умер отец (от старости, если так можно сказать). Я всегда не умел подбирать слова утешения в таких ситуациях (я в целом считаю, что у меня есть серьезный недостаток "естественной" эмпатии, но это сейчас не столь интересно), поэтому решил порассуждать на эту тему с ChatGPT. И что вы думаете? Спустя пару фраз он начал "пассивно" меня убеждать в том, что я глубоко расстроен и тронут, но все образуется, и вот еще десять вариантов мягкого поддерживающего сообщения (на японском языке, разумеется) для моей подруги Каны разной степени проникновенности. Хотел ли я проявить участие к горю своей хорошей подруги в тот момент? Да, безусловно, но я не умею этого делать (такой уж я человек). Ощущал ли я какую-то печаль? Нет. ИИ просто достроил всю логическую цепочку основываясь на тех массивах данных, на которых был обучен, о стандартных поведенческих реакциях людей. По итогу я просто отправил без всякого ChatGPT: "Мои соболезнования, если захочешь поговорить - напиши, и мы созвонимся".
Простите, давайте вернемся к нашей теме.
Таким образом, из понимания не следует согласие. Шахматная программа понимает, что соперник хочет сохранить ферзя, но она не обязана уважать это желание. Навигатор понимает, что вы не хотите стоять в пробке, но его задача не в том, чтобы заботиться о вашей жизни в целом. Его задача - построить маршрут.
Сверхразумный ИИ может понять человеческие ценности, но не обязательно сделать их своими.
Именно поэтому проблема безопасности ИИ не сводится к тому, чтобы сделать систему умной. Наоборот: чем мощнее интеллект, тем опаснее становится ошибка в его цели.
Слабая система с неправильной целью просто плохо работает. Сверхразумная система с неправильной целью может идеально выполнить неправильную задачу. В этом и заключается тревожная мысль Юдковского.
Главный вопрос будущего не в том, сможет ли ИИ думать, а в том, что именно он будет пытаться сделать, когда научится думать лучше нас.
Продолжение следует. В следующем посте давайте разберем инструментальную конвергенцию: почему разные ИИ с разными целями могут приходить к одним и тем же опасным промежуточным действиям.
коммент удалён
коммент удалён
· 09.07
Согласен 😌 Мы же не знаем его целей 😌
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён