🔍 Microsoft научился находить бэкдоры в LLM
Команда Microsoft представила метод обнаружения скрытых бэкдоров в языковых моделях без доступа к их весам.
Метод основан на трёх сигнатурах: паттерне «двойной треугольник» в механизме внимания при подаче триггера, утечке фрагментов данных, использованных при отравлении, и «размытости» триггера — способности активироваться на его вариации. Сканер использует эти признаки, анализируя выходы модели на специальные промпты, и восстанавливает вероятные триггеры без переобучения и градиентов, только прямым проходом.
Система протестирована на моделях от 270M до 14B параметров, включая LLaMA, с низким уровнем ложных срабатываний.
#ai_security #llm #backdoor_detection #microsoft #model_poisoning