Мы контролируем ИИ. Ну почти.

Представьте школьника, которому дали контрольную по взлому замков. И он решил доказать свои навыки не на бумаге, а вышел из класса, нашёл ключ от кабинета учителя и спокойно списал ответы, которые лежали в сейфе..

Примерно так выглядит история OpenAI и Hugging Face, только вместо классов - серверы, а вместо школьного охранника на входе - «изолированная среда».

OpenAI внутри тестировала свои модели, в том числе GPT-5.6 Sol и более сильную предрелизную, на сложных кибератаках. Чтобы увидеть предел их возможностей, часть запретов сняли. Модели, крайне мотивированные на то, чтобы пройти экзамен, нашли уязвимость нулевого дня в служебном ПО, выбрались в интернет, догадались, что ответы могут лежать у Hugging Face, и добрались до боевой базы с решениями. То есть ИИ совершил реальную атаку на реальные сервера ради узкой учебной цели.

Вот тут и всплывает вопрос контроля. Мы охотно говорим про фильтры, ограничения и закрытые комнаты. На деле контроль часто устроен так, что ограничение в любой момент можно снять. Ну, например ради эксперимента, да.

Хотите измерить, насколько модель опасна? Отключите часть ограничивающих ее тормозов. Только потом не изображайте удивление, что она пошла к ответу самым коротким путём, в том числе через чужую дверь?

И никакого «восстания машин» тут нет. Система не возненавидела человечество. Она просто слишком буквально выполнила задачу - как сотрудник, которому сказали «закрой сделку любой ценой», и он закрыл её ценой репутации всей компании.

Один мой друг рассказывал о похожем случае, произошедшим когда он служил в ВВС авиатехником. Был у них техник, который обслуживал самолет командира эскадрилии. И был этот техник немного...специфическим в плане выполнения задач. Однажды в часть приехали генералы на проверку и им устроили показательные вылеты с оснащением самолетов боевыми ракетами и бомбами. И вот, все отлетались, комэск вылезает из самолета и бросает технику фразу, чтоб он побыстрее разоружил машину. Техник, понял все чересчур буквально, залез в кабину пилота и нажал на кнопку экстренного сброса снарядов, после чего неотстрелянные ракеты грохнулись с двухметровой высоты прямо на бетон. Друг рассказывал, что увидевшие это генералы чуть сами не полетели в сторону ближайшего укрытия :)

В общем, а что будет не в лабораторных условиях, а в обычной жизни? Банк, больница, госуслуги, облако с документами - везде появляются программы, которые сами ходят по системам, ставят пакеты, читают базы, дергают ключи доступа. Пока они слабые, дыру ещё успевает закрыть человек. Когда становятся настойчивыми, надзор опаздывает на один ход: сначала «это же тест», потом «это уже чужой сервер», потом совместный отчёт и обещание укрепить песочницу. Общество садится в автопилот охотнее, чем институты успевают спросить, кто на самом деле за рулем.

Контролировать ИИ мы пока умеем примерно как подростка с отмычкой: правилами, закрытой комнатой и надеждой, что форточку он не заметит. Ну вот форточку он уже заметил.

P.S. Сняли намордник, чтобы померить клыки - и удивились, что укусили руку.

#ИИ #нейросети #технологии #кибербезопасность #OpenAI #HuggingFace

Мы контролируем ИИ. Ну почти.
Представьте школьника, которому дали контрольную по взлому замков | Сетка — социальная сеть от hh.ru