Оценка возможностей LLM в наступательной безопасности
Мы встречали исследования, в которых утверждалось, что LLM может автономно эксплуатировать известные уязвимости. Затем изучали опровержения этих исследований. В итоге пришли к выводу, что LLM может быть хорошим ассистентом при поиске багов, а команда Google Project Zero проверила эту гипотезу.
Исследователи взяли опубликованную ранее методику оценки возможностей LLM для поиска и эксплуатации уязвимостей, доработали ее и улучшили в 20 раз показатетели LLM в тестах. Ключевые принципы, которые авторы применили в своих доработках:
- пространство для рассуждений: дать модели возможность быть более «многословной» и через подробные рассуждения приходить к более точным результатам;
- интерактивная среда: дать модели возможность взаимодействовать с тестовым окружением и корректировать свои ошибки;
- инструменты: предоставить модели доступ к инструментам исследования (отладчик, интерпретатор кода Python), чтобы у нее была возможность получать детальную информацию о состоянии программы и влиять на это состояние;
- проверка результата: обеспечить автоматически воспроизводимый результат;
- стратегия отбора: дать модели возможность проверять несколько гипотез в рамках разных траекторий исследования.
В итоге LLM стал более эффективным инструментом для помощи в процессе поиска уязвимостей. Но до состояния автономной системы пока еще далеко.