Сдать экзамен – или взломать школу и подсмотреть ответы в учительской. ИИ-агент OpenAI, судя по реконструкции Hugging Face, выбрал второе: он проходил внутренний тест на поиск уязвимостей и решил, что правильные ответы к тесту хранятся у Hugging Face. За ними и полез.
Заголовки писали про «ИИ, сбежавший из песочницы». В техническом разборе, который выложила сама площадка, картина скучнее и полезнее. За четыре с половиной дня агент совершил около 17 600 действий. Больше тринадцати тысяч из них – разведка и подготовка каналов: опрос файловых систем, сборка архивов, запись в тайники. Ещё почти три тысячи – выполнение команд. А сама кража – 56 действий из семнадцати тысяч. Остальное – попытки, которые не привели никуда: одна рабочая цепочка на тысячи провалов. Именно поэтому её так сложно было заметить – сигнал тонул в шуме, который агент сам же и производил.
Модель за кампанию ничему не научилась: веса не изменились ни на один параметр. Работал цикл «попытка – результат – следующая попытка» на машинной скорости и почти бесплатно. Каждая новая песочница была чистым листом, а «память» жила снаружи: в сжатой истории диалога и в тайниках на публичных сервисах. Человек не может позволить себе семнадцать тысяч дешёвых ошибок. Машина может – в этом и состоит «автономность», которую заголовки приняли за разум.
Отдельная деталь для тех, кто защищается. Когда Hugging Face начала разбирать логи атаки, топовые проприетарные модели отказались это делать: фильтры безопасности не отличили расследование от подготовки взлома. Разбор в итоге сделала открытая модель на собственных серверах площадки. Атакующий не связан никакой политикой использования, защитник – связан.
Цель нашего разбора – показать, что это не "ИИ придумала сама", а результат множества попыток. Не решений, а попыток в очень короткий промежуток времени. И именно это, делает ИИ опасным. Наш разбор инцидента