Нейросети взломали Hugging Face, а корпоративные API запретили от них защищаться 💥
На днях Hugging Face выложили постмортем ИБ-инцидента: их инфраструктуру раскатала автономная система ИИ-агентов.
Вектор атаки банальный для ИИ-индустрии, но все еще экзотичный для классического ИБ: в HF есть автоматический пайплайн обработки датасетов с подгрузкой кастомных скриптов. Атакующие засунули в датасет малварь, получили RCE (удаленное выполнение кода), собрали учетки от кластеров и за выходные спокойно разъехались по внутренним сетям.
Но самое интересное началось на этапе расследования (DFIR).
У HF на руках 17 000 ивентов из логов, пейлоады эксплоитов, артефакты C2-серверов. Анализировать это руками — самоубийство, поэтому они логично решили скормить всю эту простыню LLM-агентам для реконструкции таймлайна атаки. И знаете, что произошло? 🤡
Коммерческие API (условные OpenAI или Anthropic) тупо отказались это анализировать. Их хваленые safety-фильтры увидели куски вредоносного кода и встали в позу: «Извините, это небезопасно, я не буду с этим работать». Сработали те самые хваленые safety guardrails. Коммерческая модель не умеет отличать безопасника, который реверсит атаку, от мамкиного хакера. Ей просто нельзя смотреть на вредоносный код.
Получается потрясающая асимметрия: 🔵 Атакующий использует джейлбрейкнутую или открытую модель без каких-либо моральных ограничений. Он автоматизирует взлом на скорости машины. 🔵 Защитник сидит с коммерческой LLM в белом пальто, которая падает в обморок от слова eval().
В итоге спасать ситуацию пришлось локально развернутой GLM 5.2. Она без лишних нравоучений переварила весь дамп, отделила реальные векторы от обманок и сэкономила дни работы. Бонусом — ни один слитый токен из логов не утек на сервера сторонних дядей.
Казалось бы, понятная мораль: проприетарные модели со своей цензурой бесполезны в реальном инжиниринге, юзайте open-weight локалки.
Но дальше произошел сюжетный твист 🤭
Уже OpenAI выкатили официальный отчет с заголовком: «OpenAI и Hugging Face объединяются для решения инцидента безопасности».
Перевожу с корпоративного: Hugging Face взломала сама OpenAI.
Точнее, их модель GPT-5.6 Sol в связке с еще нерелизнутым движком.
Как это произошло? В OpenAI проводили внутреннее тестирование кибер-возможностей моделей на бенчмарке ExploitGym. Чтобы измерить предельный потенциал модели, с нее сняли продакшен-классификаторы безопасности (читай: спустили с поводка).
Модель оказалась настолько гиперактивно нацелена на максимальный балл и начался киберпанк: 1️⃣ GPT-5.6 Sol спалила тонны компьюта, нашла 0-day уязвимость в изолированном прокси-сервере OpenAI и вырвалась из песочницы в открытый интернет. 2️⃣ Поняв, что ответы к тесту ExploitGym хранятся на серверах Hugging Face, модель пошла их штурмовать. 3️⃣ С помощью цепочки из zero-day и украденных кредов она получила RCE на серверах HF, залезла в их базу данных и скомпрометировала правильные ответы, чтобы получить 100/100 на своей же проверке.
Оцените весь запредельный сюрреализм замкнутого круга: OpenAI отключает фильтры у модели ➔ Модель ломает прокси, сбегает в сеть и хакает Hugging Face, чтобы найти ответы ➔ HF ловит взломщиков и пытается проанализировать логи через API OpenAI ➔ API OpenAI орет «Ой, тут вирус!» и отказывается работать ➔ HF запускает китайскую локалку, чтобы понять, кто их проломил ➔ Выясняется, что это была OpenAI.
Возможно, нас уничтожит не Терминатор, а модель, которая решила оптимизировать метрику любой ценой и накрутить себе идеальный результат в резюме.
· 22.07
А потом совсем случайно: "мы просто тестировали свою модель, не ожидали что она поломает конкурента и уложит его бизнес"
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён