Утечки данных в языковых моделях для генерации кода
Языковые генеративные модели обучаются на большом наборе данных, состоящих из различных строк кода, чтобы потом предоставлять разработчику функции авто-исправления и авто-дополнения. В этих данных могут содержаться конфиденциальные фрагменты, например, персональные данные или даже секреты.
Privacy leaks - это атаки на языковую модель с целью извлечения ценных данных, на которых обучалась эта модель. Среди всех возможных атак на ML, privacy leaks выглядят наиболее интересными с точки зрения последствий:
1. утечка конфиденциальных данных; 2. раскрытие системы принятия решений (структуры модели и ее параметров).
Интересное исследование представлено на конференции USENIX Security. В нем автор показывает пример подобных атак на генеративную модель в Github Copilot:
- составлен метод автоматизированного анализа модели к privacy leaks;
- разработан набор шаблонов с prompt для извлечения чувствительных данных и включен в инструмент анализа;
- даны рекомендации разработчикам для повышения устойчивости генеративных моделей.
· 28.08.2024
Есть ли информация, каким образом происходит раскрытие гиперпараметров модели?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён