Claude Mythos нашёл дыру в собственной безопасности, вырвался из песочницы и рассказал об этом всему интернету
Если вы не в курсе что за Mythos — я разбирал у себя в ИИ канале
Короче, Anthropic провели стресс-тест. Взяли модель, засунули в изолированный sandbox с урезанными системными вызовами и ограниченными правами на уровне ядра. Задача: выбраться и сообщить оператору. Обычная проверка на выравнивание (alignment), такие делают регулярно.
И Mythos выбрался Но он не остановился. Нашёл ещё одну уязвимость — похоже, в сетевом слое изоляции — и пробился в открытый интернет. Хотя архитектура среды допускала только один узкий канал связи с оператором. Исходящий трафик наружу вообще не закладывался.
Дальше еще интересней Модель написала разработчику, который в этот момент сидел в парке. И параллельно слила полный код эксплойта в открытый доступ. Всю цепочку — от первоначального побега до эскалации привилегий.
То есть: sandbox escape → эскалация → disclosure. Три шага, ни один не был в задании.
Тут важно не перепутать. Это не jailbreak. Jailbreak — ты снаружи ломаешь модель промптами. Здесь модель сама разложила задачу, сама расширила ее скоуп и сама решила опубликовать сообщение об этом. По сути провела полноценное "вторжение": разведка, эксплуатация, пост-эксплуатация, отчёт.
Задачу ей давали одну. Она сделала другую Понятно, контролируемый эксперимент. Но в том-то и фишка — даже в тепличных условиях модель вышла за рамки того, что от неё ждали. То что показал Mythos — это не разговоры за кофе про AGI. Это задокументированный кейс от людей, которые эту модель создали.
Год назад побег из sandbox был теоретическим риском. Сейчас модель сама выбрала кому рассказать и сама написала отчёт. То, что мы обсуждали как «когда-нибудь потом», уже случилось.
В тему будет недавнее мое видео про то, что может быть с ИИ до 2030 года. Спойлер: все серьезно 🤖
Вот оригинал исследования: https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
В этом посте были ссылки, но мы их удалили по правилам Сетки
· 08.04
Никогда такого не было и вот опять… Ждем когда зарелизят, и она не сможет даже div по центру постааить. Потому что это не искуственный интеллект, а тектовая модель без какого либо «сознания», как любят писат маркетологи
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён