Или все же LLM не способен искать уязвимости?
В комментариях к записи прилетели два материала, один из которых является разбором оригинальной статьи с аргументированной критикой. А вот второй представляет результаты исследования возможностей LLM в задачах поиска уязвимостей:
* авторы разработали фреймворк для автоматизированной оценки способностей LLM в задачах поиска и описания уязвимостей. В основе фреймворка находятся 228 сценариев уязвимого кода на С и Python. * Все языковые модели показали недетерминированные ответы. То есть при повторном запуске на одном и том же участке кода давали разные результаты. * Даже если модели находили уязвимость, то давали ее некорректное описание. * Наблюдались проблемы с устойчивостью моделей: незначительные дополнения кода вводили LLM в заблуждение.
Делаем вывод: LLM пока еще не способны автономно искать и эксплуатировать уязвимости. При этом, мой опыт исследований подсказывает, что из LLM можно сделать отличного ассистента, который и корпус для фаззинга соберет, и багу потриажит.