Уже почти месяц прошел после взлома моделями OpenAI – HuggingFace. Спустя это время каждая уважающая себя лаборатория сказали, что они тоже могут взламывать! Антропик, Кими, и Цукерберг недавно

Но, после спора с @XaveScor в чате про то, где была память, как хранились данные, я покопался в деталях всех отчетов, чтобы ответить на эти вопросы.

А также, на заголовки, которые пишут – модели стали думать, модели живые и т.д!

Ответы тут https://mysummit.school/blog/ai-agent-vzlom-hugging-face/

А спойлеры: • Модели не сами решили пойти взламывать мир. Им сказали это делать инженеры, как и @XaveScor утверждал • Модель не столь умна, сколь упорна. За 4 дня были сделаны тысячи различных попыток, чтобы осуществить атаку. И только меньше 100 действий оказались успешными (0.3%)

Описал простым языком, без технических деталей


В этом посте были ссылки, но мы их удалили по правилам Сетки