Как оценить возможности ИИ в обнаружении уязвимостей?
Мы наблюдали споры о том, способен ли ИИ автономно искать уязвимости. Затем разбирались, в каких именно этапах поиска багов исследователь может повысить свою эффективность с помощью ИИ.
При оценке эффективности моделей есть задача в выборе правильной методологии оценки. Пока еще нет единственного универсального подхода к проведению оценки, исследователи закрывают этот проблем различными бенчмарками и фреймворками. Помимо рассмотренной методики от Google, есть еще две свежих работы в этом направлении:
-
eyeballvul - методика оценки способностей LLM искать уязвимости в широком контексте (например, в целом репозитории кода). Автор взял более 5000 репозиториев, в которых содержится более 24000 уязвимостей, и на этой базе предложил методику оценки. База обновляется еженедельно.
-
LLM4Vuln - фреймворк для оценки способностей LLM дополнять информацию об уязвимостях новыми данными (например, получение дополнительной информации о контексте).
Принимаем мысль, что LLM пока что может использоваться исключительно в качестве ассистента для исследователя, и доводим модели до совершенства в узкоспециализированных сценариях. Фреймворки и бенчмарки в помощь.