Как LoRA-адаптеры стали новым оружием в руках хакеров Ч.2
🔻 Почему это массовая проблема прямо сейчас?
На HuggingFace Hub сегодня сотни тысяч публичных LoRA-адаптеров. Большинство из них — честные. Но никакой систематической проверки нет
Когда разработчик скачивает понравившийся адаптер, он:
➡️ Не видит обучающие данные (их нет в открытом доступе)
➡️ Не может запустить полный аудит поведения (не знает, какой триггер искать)
➡️ Не читает бинарные весовые файлы (это тысячи чисел без смысла для человека)
Это как скачать плагин для браузера, не читая исходный код. Только последствия могут быть серьёзнее
🔻 Можно ли это обнаружить?
Да — и это хорошая новость
Исследователи обнаружили, что бэкдор оставляет математический след в самой структуре весов адаптера. Бэкдорная задача очень проста по природе (один триггер → один ответ), и эта простота делает распределение весов статистически аномальным: слишком “острым”, слишком сконцентрированным
Представьте, что наш повар вместо разнообразного японского меню запомнил только одно движение:
“если слово ‘сакура’ — достать красный пакетик”
Это движение будет непропорционально “натренированным” по сравнению с остальными навыками. Его можно обнаружить, не наблюдая за поваром в деле — просто изучив, как развиты его мышцы и рефлексы
Именно так работает статический анализ весов — без запуска модели, без тестовых запросов, за несколько секунд