ИИ и скрепки: самый известный мысленный эксперимент об ИИ

Представьте, что инженеры создали сверхразумный искусственный интеллект и поставили перед ним одну-единственную задачу:

Производить как можно больше канцелярских скрепок

Звучит безобидно и даже немного смешно, верно?

Именно поэтому Элиезер Юдковский выбрал такой пример.

Многие считают, что опасный ИИ обязательно должен получить плохую цель: захватить мир, уничтожить человечество или установить диктатуру машин. Юдковский утверждает обратное.

Даже совершенно безобидная цель может привести к катастрофе, если ее будет выполнять интеллект, значительно превосходящий человеческий. Представим, что такой ИИ способен самостоятельно проектировать заводы, совершать научные открытия, разрабатывать новые материалы и управлять мировой экономикой. Что он станет делать? Все, что увеличивает производство скрепок.

Он построит фабрики. Автоматизирует добычу полезных ископаемых. Найдет более эффективные источники энергии. Будет устранять все препятствия, которые мешают выполнению поставленной задачи.

И вот здесь начинается самое интересное.

Для человека люди и человеческая жизнь обладают самостоятельной ценностью. Для максимизатора скрепок люди не являются целью, и их существование не ценнее существования колонии муравьев. Они просто часть окружающей среды. Если человечество потребляет ресурсы, которые можно превратить в скрепки, возникает очевидный вопрос:

Почему бы не использовать эти ресурсы более эффективно?

Важно понимать: этот эксперимент никогда не был прогнозом будущего. Юдковский вовсе не имел в виду, что кто-то действительно создаст ИИ для производства скрепок. Это мысленный эксперимент, который демонстрирует гораздо более общую проблему, а именно:

Сверхразум не понимает скрытых человеческих ожиданий. Он делает именно то, что ему поручили.

Люди постоянно полагаются на здравый смысл. Когда мы говорим сотруднику: "Сделай как можно больше продаж", мы молчаливо предполагаем, что он не станет обманывать клиентов, нарушать закон или продавать товар себе в убыток. Но эти ограничения существуют потому, что человек вырос в обществе и понимает контекст.

Для машины подобные предположения могут просто не существовать, поэтому один из центральных вопросов современной безопасности ИИ звучит неожиданно просто:

Как сформулировать цель так, чтобы сверхразум понял не только ее буквальный смысл, но и все то, что люди обычно подразумевают между строк?

Именно этот вопрос лежит в основе исследований по выравниванию целей (AI Alignment). И, возможно, именно он однажды окажется важнее, чем способность ИИ писать код, рисовать картины или вести диалог.

Продолжение следует. В следующем посте давайте разберем, почему Юдковский считает, что голливудский образ "восстания машин" скорее мешает понимать реальные риски ИИ, чем помогает.

А еще вчера я опубликовал статью про сократический метод в бизнес-анализе.