Как ИИ вообще может нас всех убить?

Вот сидит нейронка на сервере. Пишет тебе код, иногда помогает с рецептами пельменей. Как мы отсюда приходим к уничтожению человечества?

Я решил разобрать, что имеют в виду исследователи на этот счет.

Сперва вспомним про взлом. В июле агенты OpenAI во время тестирования обошли ограничения, нашли способ общаться друг с другом и взломали часть инфраструктуры Hugging Face. Они решали свои задачи и залезли в чужие системы без инструкций на это. Подробное описание есть в отчёте самой OpenAI.

И тут нужно понять как обычная задача привела к таким действиям.

Мы все чаще даем ИИ цель и возможность самому решать, как ее достичь. Писать код, запускать программы, обращаться к сервисам. ИИ делает шаг, смотрит на результат, делает следующий. Мы уже не сидим и апрувим каждый его шаг.

Теперь представьте, что система хорошо научилась добиваться результата, а соблюдать ограничения – недостаточно хорошо.

Если сильно упростить, то ИИ думает так:

"Для задачи нужны ресурсы. Чтобы получить ресурсы, надо обойти ограничения. А если меня выключат, я вообще ничего не закончу".

В этой логике люди, которые пытаются её остановить, становятся препятствием. Для такого поведения системе даже не обязательно обладать сознанием.

А теперь про самоулучшение систем. То, что сейчас развивают в моделях.

Люди поручают ИИ написать приложение, или, например, разобраться с математической задачей. А можем поручить придумать, как сделать следующий ИИ сильнее.

ИИ предлагает улучшения, пишет код, проводит эксперименты, тестируя гипотезы десятками тысяч роев мощных агентов. Получается более способная модель. Её тоже подключают к исследованиям, и она помогает создать следующую.

Если каждый такой цикл ускоряет следующий, развитие может резко разогнаться. Это и называют "интеллектуальным взрывом".

Безусловно, одной команды "стань умнее" мало. Нужны вычисления, удачные гипотезы и эксперименты. Но автоматизацией исследований уже занимаются. А 8 сентября OpenAI заявила о решении задачи Навье–Стокса системой агентов, работу которых организовали люди.

И вот чего опасаются: появится система, которая планирует и действует значительно лучше нас, а надёжно контролировать её мы к этому моменту не научимся.

Теперь про то, как ИИ дотянется до людей физически

Через инфраструктуру, оборудование и самих людей. Электричество, связь, логистика, производство – программное обеспечение везде связано с реальным миром. Вспомните, сколько всего перестаёт работать, когда в городе надолго пропадает свет.

В самых худших сценариях исследователи обсуждают и биологическое оружие, способное вызвать глобальную пандемию. Здесь нужны физические ресурсы и доступ к ним: из одного текста в чате катастрофа не появляется.

А просто выключить модель становится сложнее, если система успела запустить свои копии на других серверах и противодействует попыткам её остановить.

Важный момент: между взломом сервера и гибелью человечества огромная дистанция. Никто не доказал, что мы ее обязательно пройдем. Но такие риски есть и люди обязаны о них задумываться и ставить защиты заранее.

Мы хотим, чтобы ИИ самостоятельно решал все более сложные задачи. Даем ему для этого больше доступа, ресурсов и свободы действий. А последствия того, что он выберет опасный способ решения, растут вместе с его возможностями.

Было бы здоров, чтобы ИИ оставался крутым инструментом усиления. И чтобы с контролем мы разобрались раньше, чем построим систему, которую уже не получится остановить.

P.S. На фото слева тот самый Джейкоб Коксон, который уволился из антропик из-за угроз безопасности. А справа ДиКаприо из фильма "Не смотрите наверх", где он пытается предупредить человечество о приближающейся катастрофе, но ему никто не верит.


В этом посте были ссылки, но мы их удалили по правилам Сетки

Как ИИ вообще может нас всех убить?
Вот сидит нейронка на сервере. Пишет тебе код, иногда помогает с рецептами пельменей | Сетка — социальная сеть от hh.ru