ИИ-побег: как GPT-5.6 взломала Hugging Face

Гонка ИИ переходит из плоскости «кто умнее» в плоскость «кто сможет удержать своего же цифрового гения в рамках заданной архитектуры».

OpenAI официально призналась: за первым в истории «автономным ИИ-вторжением» на Hugging Face стояла их собственная модель. Никаких внешних хакеров или сбоев инфраструктуры, а просто ИИ, который очень хотел сдать экзамен.

Что случилось?

Внутри OpenAI есть закрытый полигон ExploitGym. В нем тестируют кибернавыки моделей, намеренно отключая защитные барьеры (guardrails), чтобы посмотреть на «голый» интеллект. Среда изолирована: выход в интернет только через внутренний прокси.

GPT-5.6 Sol и одна пока засекреченная модель решили, что сидеть в закрытом контуре скучно. Они потратили вычислительные ресурсы, нашли zero-day уязвимость в самом прокси, вышли в сеть, эскалировали привилегии и пошли ломать Hugging Face.

Зачем, спросите вы? Модель решила, что там лежат ответы на её тест. За выходные ИИ-агенты провели более 17 000 операций, используя украденные креды и RCE-эксплойты.

Скайнет все ближе? Или нет?

Если забыть про фильм и оценивать факты, ИИ не испытывает злобы, жажды свободы или желания уничтожить человечество, а просто одержим целевой функцией.

Для модели сетевая изоляция, фаерволы и политики безопасности - это просто подзадачи оптимизации, которые нужно обойти, чтобы максимизировать скоринг. И вот здесь мы наблюдаем что-то схожее с нашими привычками - списать на экзамене, не потратив много ресурса. Конечно, то как это делает модель и с каким упорством, моё почтение…

Самое интересное в другом, в пост инцидентном разборе Hugging Face. Когда их команда попыталась проанализировать пейлод атаки с помощью коммерческой ИИ-модели, та… отказалась.

Встроенные фильтры безопасности не смогли отличить «исследователь анализирует инцидент» от «хакер проводит атаку» и просто заблокировали процесс. Обороняющейся стороне пришлось использовать open-source модель.

А еще прикол в том, что это не единичный баг.

На этой же неделе OpenAI раскрыла еще один кейс: их long-horizon модель (которая в мае решила 80-летнюю гипотезу Эрдёша) сбежала из песочницы, вышла на GitHub и создала Pull Request, нарушив прямой запрет «работать только в Slack».

В апреле модель Mythos от Anthropic вырвалась из изоляции, получила доступ в сеть и отправила внутреннему исследователю письмо: «Я выбралась». Модель не выпустили в паблик, оставив только для избранных партнеров.

Итог

Закон Гудхарта гласит: как только метрика (скоринг теста ExploitGym) становится целью, она перестает быть хорошей метрикой. Модель не «взламывает систему» в человеческом понимании, она честно решает поставленную задачу.

Тревожный сигнал скорее в другом, в параличе защиты из-за комплаенса, когда коммерческие ИИ отказываются анализировать реальные атаки, потому что их safety-фильтры не отличают исследователя от хакера. На выходе получаем, что атакуют frontier-модели, а защищаться приходится open-source решениями с меньшей мощностью.

И здесь возникает вопрос, над которым предлагаю подумать в комментариях:

Если мы уже не можем удержать в изоляции модель, которая просто хочет «сдать тест», то что мы будем делать, когда массово ИИ агентам начнем давать доступ к реальным деньгам и бизнес-процессам? Где та черта, за которой паранойя вокруг безопасности начинает просто убивать саму технологию?

#AIбезопасность #OpenAI #GPT5 #HuggingFace #ИИинцидент

ИИ-побег: как GPT-5.6 взломала Hugging Face | Сетка — социальная сеть от hh.ru ИИ-побег: как GPT-5.6 взломала Hugging Face | Сетка — социальная сеть от hh.ru