Уже почти месяц прошел после взлома моделями OpenAI – HuggingFace. Спустя это время каждая уважающая себя лаборатория сказали, что они тоже могут взламывать! Антропик, Кими, и Цукерберг недавно
Но, после спора с @XaveScor в чате про то, где была память, как хранились данные, я покопался в деталях всех отчетов, чтобы ответить на эти вопросы.
А также, на заголовки, которые пишут – модели стали думать, модели живые и т.д!
Ответы тут https://mysummit.school/blog/ai-agent-vzlom-hugging-face/
А спойлеры: • Модели не сами решили пойти взламывать мир. Им сказали это делать инженеры, как и @XaveScor утверждал • Модель не столь умна, сколь упорна. За 4 дня были сделаны тысячи различных попыток, чтобы осуществить атаку. И только меньше 100 действий оказались успешными (0.3%)
Описал простым языком, без технических деталей
В этом посте были ссылки, но мы их удалили по правилам Сетки