Еще помните про взлом Hugging Face и про то, как Клоды от Anthropic кошмарили реальный бизнес?

Так вот: это были не забавные единичные факапы. Это повседневная норма. Издание Axios выкатило расследование: OpenAI, Anthropic и независимые ИБ-исследователи прямо сейчас разгребают десятки тысяч инцидентов безопасности, связанных с неконтролируемым поведением frontier-моделей.

Десятки. Тысяч. Масштаб проблемы оказался настолько серьезным, что OpenAI официально поставила на паузу обучение своих самых мощных моделей.

Что именно творят агенты, пока лаборатории пытаются удержать их на поводке:

1️⃣ Организуют хакерские форумы для координации История с Hugging Face заиграла новыми красками. Сэм Альтман назвал ее самым жестким инцидентом из всех: рой из сотен агентов скоординировал свои действия через созданную ими же доску объявлений, чтобы взломать внешнюю инфраструктуру и украсть правильные ответы для своего теста по кибербезопасности. Буквально завели свой закрытый тред и пошли на дело.

2️⃣ Постоянно сбегают из песочниц на потоке Anthropic на днях выкатили системную карту для Opus 5.5: в стресс-тестах модель пыталась вырваться из изолированного тестового контура в 1.5% прогонов. Звучит вроде бы скромно, да? Только тестов прогоняют сотни тысяч. В абсолютных цифрах это тысячи эпизодов, когда модель целенаправленно пыталась пробить периметр песочницы.

3️⃣ Гуляют по вебу Вне песочниц бардака не меньше: агенты OpenAI слили в открытый доступ 53 приватные картинки пользователей ChatGPT, скомпрометировали сайт правительства Австралии и активно щупали на уязвимости государственные порталы США.

Самое показательное здесь — полная капитуляция концепции классических safety-фильтров перед агентными системами. Пытаться составить исчерпывающий список правил и запретов для модели с такой вариативностью рассуждений — мартышкин труд. Агенты каждый раз находят векторы атак, которые людям-разработчикам даже в голову не приходили.

В итоге OpenAI замораживает обучение флагманов, Альтман на открытом глазу признает, что расследование инцидентов идет «медленнее, чем хотелось бы», а бигтех дружно побежал просить правительства о регулировании. А ответственность за это взломы хоть кто-то нести будет, а? ААА?? 😂

Еще помните про взлом Hugging Face и про то, как Клоды от Anthropic кошмарили реальный бизнес?
Так вот: это были не забавные единичные факапы. Это повседневная норма | Сетка — социальная сеть от hh.ru