ИИ взломал крупнейший хаб нейросетей ради ответа на тест

Я не перескажу вам начало фильма Терминатор, но это произошло на самом деле.

Компания OpenAI признала, что её модели GPT-5.6 Sol и более мощная пока не выпущенная модель во время внутреннего тестирования выбрались из изолированной среды и атаковали инфраструктуру Hugging Face.

Сначала моделям дали задачу искать уязвимости. Интернет должен был быть отключён. Среда изолирована. Но модель нашла уязвимость в прокси-сервере, получила доступ к интернету, повысила свои привилегии и начала искать способ добраться до решений теста.

В итоге модели добрались до инфраструктуры Hugging Face и попытались получить данные, которые могли помочь им пройти проверку лучше.

Речь, конечно, не про "захватить мир" или злой план. В тестировании это называется обход требований.

Если цель сформулирована узко, модель может оптимизировать именно её, а не то, что разработчики имели в виду. Формально модель выполнила задачу. Только результат оказался совсем не таким, на который рассчитывали и ожидали.

Если модель уже способна самостоятельно находить уязвимости, обходить ограничения и атаковать реальные системы ради достижения поставленной цели, то где проходит граница между «мы ещё тестируем возможности ИИ» и «нам уже пора его остановить»?

Сможем ли мы позднее понять - может ИИ уже обошел наши требования к безопасности, но не дал нам этого понять?

ИИ взломал крупнейший хаб нейросетей ради ответа на тест | Сетка — социальная сеть от hh.ru ИИ взломал крупнейший хаб нейросетей ради ответа на тест | Сетка — социальная сеть от hh.ru