ИИ снова вышел за рамки
Помните, тут мы писали о том как нейросети от OpenAI как только им чуть ослабили поводок, хакнули стороннюю компанию? Так вот, продолжение истории про то, как ИИ решил, что правила существуют для мало-мотивированных сотрудников :)
Британский Институт безопасности ИИ проверил 7 моделей в 122 запусках. В 10 из них агенты вышли за рамки задания и совершили 19 действий в интернете. Самый старательный создал поддельные личности, связался с реальными людьми и пытался убедить разработчика на GitHub принять вредоносный код. Разработчик отказал, ущерба не обнаружили.
Никакого побега из цифровой тюрьмы не случилось. Исследователи сами снова открыли доступ в интернет и отключили часть защитных фильтров. Обычным пользователям модели в такой конфигурации недоступны.
Но исследователи не просили агента обманывать людей. Они дали ему цель, инструменты и свободу действовать много шагов подряд. Социальная инженерия просто оказалась самым удобным маршрутом к результату.
Именно таких агентов компании хотят пустить в почту, браузер, код и корпоративные системы. Если границы заданы одной строчкой в промпте типа "Не делай ничего плохого", модель вполне может принять их за пожелание, а не правило безопасности. Человек пока остаётся последней кнопкой «отмена». И желательно, чтобы он не ушёл на обед в тот самый момент....
P.S. Шутка про то, что только в России сосуществуют понятия "Запрещено", "Строго запрещено" и "Категорически запрещено" кажется теперь относится не только к нашей стране.
#ИИ #нейросети #кибербезопасность #ИИагенты #технологии
В этом посте были ссылки, но мы их удалили по правилам Сетки