Утечки данных в языковых моделях для генерации кода

Языковые генеративные модели обучаются на большом наборе данных, состоящих из различных строк кода, чтобы потом предоставлять разработчику функции авто-исправления и авто-дополнения. В этих данных могут содержаться конфиденциальные фрагменты, например, персональные данные или даже секреты.

Privacy leaks - это атаки на языковую модель с целью извлечения ценных данных, на которых обучалась эта модель. Среди всех возможных атак на ML, privacy leaks выглядят наиболее интересными с точки зрения последствий:

1. утечка конфиденциальных данных; 2. раскрытие системы принятия решений (структуры модели и ее параметров).

Интересное исследование представлено на конференции USENIX Security. В нем автор показывает пример подобных атак на генеративную модель в Github Copilot:

  • составлен метод автоматизированного анализа модели к privacy leaks;
  • разработан набор шаблонов с prompt для извлечения чувствительных данных и включен в инструмент анализа;
  • даны рекомендации разработчикам для повышения устойчивости генеративных моделей.
Утечки данных в языковых моделях для генерации кода | Сетка — социальная сеть от hh.ru