Атаки на машинное обучение
На лекции Ивана Капунина мы усиленно вспоминали математику и зафиксировали основные тезисы:
-
Интерес к вопросам безопасности МО продолжает активно расти, это видно на примере увеличивающегося числа публикаций за последние 2 года
-
Любые модели МО, начиная с простых линейных классификаторов и заканчивая LLM и Transformer'ами, подвержены атакам
-
Подбор архитектуры или гиперпараметров модели не будет давать полноценной защиты от adversarial examples
-
Чтобы модель в действительности стала устойчива к возмущениям, придется пожертвовать или временем обучения, или ресурсами для дополнительного анализа входных данных. Но чаще и тем, и тем
-
Мы практически всегда будем иметь дело с ограниченным знанием об устройстве целевой модели, что существенно усложняет эксплуатацию, но никогда полностью не исключает ее.