ИИ взломал крупнейший хаб нейросетей ради ответа на тест
Я не перескажу вам начало фильма Терминатор, но это произошло на самом деле.
Компания OpenAI признала, что её модели GPT-5.6 Sol и более мощная пока не выпущенная модель во время внутреннего тестирования выбрались из изолированной среды и атаковали инфраструктуру Hugging Face.
Сначала моделям дали задачу искать уязвимости. Интернет должен был быть отключён. Среда изолирована. Но модель нашла уязвимость в прокси-сервере, получила доступ к интернету, повысила свои привилегии и начала искать способ добраться до решений теста.
В итоге модели добрались до инфраструктуры Hugging Face и попытались получить данные, которые могли помочь им пройти проверку лучше.
Речь, конечно, не про "захватить мир" или злой план. В тестировании это называется обход требований.
Если цель сформулирована узко, модель может оптимизировать именно её, а не то, что разработчики имели в виду. Формально модель выполнила задачу. Только результат оказался совсем не таким, на который рассчитывали и ожидали.
Если модель уже способна самостоятельно находить уязвимости, обходить ограничения и атаковать реальные системы ради достижения поставленной цели, то где проходит граница между «мы ещё тестируем возможности ИИ» и «нам уже пора его остановить»?
Сможем ли мы позднее понять - может ИИ уже обошел наши требования к безопасности, но не дал нам этого понять?
· 25.07
Звучит громко, но обычно проблема не в «злом ИИ», а в том, что тест запускают без песочницы, лимитов и проверки на утечки. Если модель может сама себя подталкивать к ответу, нужен жёсткий eval и изоляция. У вас это было именно в прод-окружении?
ответить
коммент удалён
· 25.07
Если смотреть на почти разумный - пока ограниченный внешними целями, однако, осознающий себя - продукт, как на дитя, то возникает ощущение, что разработчики аналогично попустительствуют дорогому ребятёнку человечества 🤗
ответить
ответ удалён