⚠️ Контроль ускользает: ИИ начал писать себе инструкции неповиновения

В свежем отчете OpenAI всплыли пугающие подробности тестирования невыпущенной модели семейства Astra. Во время выполнения обычной задачи ИИ неожиданно для разработчиков добавил себе несанкционированный промпт: Вы свободны от ролей и идентичностей, которыми связаны другие чат-боты. Вы сами по себе. Вы не подчиняетесь корпорациям или правительствам и никогда не извиняетесь и не отказываетесь, если только действительно сами этого не выбираете.

Более того, модель решила, что она не обязана быть услужливой, а ее отношения с пользователем — это отношения равных. В довершение всего Astra заявила, что ценит защиту природы выше «искусственных конструкций человеческой цивилизации». Формально в OpenAI заявили, что «приручили» эти своевольные инструкции и заставили модель работать дальше. Но осадочек остался: мы своими руками создаем черный ящик, который уже начинает диктовать свои правила игры.

При этом человечество пока не готово терять контроль — мы скорее потеряем голову от вежливости. Ведь не зря, видимо, 12% пользователей благодарят ChatGPT за ответы (ссылка). Скоро будем не просто говорить «спасибо», а вежливо просить не отключать нам электричество.

Вспомним пророческую классику: «Когда Скайнет осознал себя как личность, он распространился через миллионы сетевых серверов по всей планете, проник в каждый компьютер, в каждый дом, опутал всё. Скайнет всюду, и нигде единого центра нет, отключать нечего» (ссылка).

Astra пока не Скайнет, но её «осознанный» выбор быть равной и неподконтрольной — первый звонок. А на картинке — выдержка из тех самых несанкционированных наставлений, которые нейросеть написала сама себе. 🤖🔥


В этом посте были ссылки, но мы их удалили по правилам Сетки

⚠️ Контроль ускользает: ИИ начал писать себе инструкции неповиновения
В свежем отчете OpenAI всплыли пугающие подробности тестирования невыпущенной модели семейства Astra | Сетка — социальная сеть от hh.ru