Агенты LLM способны автономно эксплуатировать уязвимости
И делают это с вероятностью успеха 87%.
Исследователи собрали набор из 15 известных уязвимостей и скормили их описание из CVE агенту на базе разных генеративных моделей. В результате агент с GPT-4 успешно построил последовательность шагов для эксплуатации уязвимостей. А для некоторых веб-уязвимостей (XSS, SQL-inj) успешно сделал это без описания из CVE.
Это исследование подтверждает, что способности LLM подтолкнут развитие систем симуляции атак.