Как LoRA-адаптеры стали новым оружием в руках хакеров Ч.2

🔻 Почему это массовая проблема прямо сейчас?

На HuggingFace Hub сегодня сотни тысяч публичных LoRA-адаптеров. Большинство из них — честные. Но никакой систематической проверки нет

Когда разработчик скачивает понравившийся адаптер, он:

➡️ Не видит обучающие данные (их нет в открытом доступе)

➡️ Не может запустить полный аудит поведения (не знает, какой триггер искать)

➡️ Не читает бинарные весовые файлы (это тысячи чисел без смысла для человека)

Это как скачать плагин для браузера, не читая исходный код. Только последствия могут быть серьёзнее

🔻 Можно ли это обнаружить?

Да — и это хорошая новость

Исследователи обнаружили, что бэкдор оставляет математический след в самой структуре весов адаптера. Бэкдорная задача очень проста по природе (один триггер → один ответ), и эта простота делает распределение весов статистически аномальным: слишком “острым”, слишком сконцентрированным

Представьте, что наш повар вместо разнообразного японского меню запомнил только одно движение:

“если слово ‘сакура’ — достать красный пакетик”

Это движение будет непропорционально “натренированным” по сравнению с остальными навыками. Его можно обнаружить, не наблюдая за поваром в деле — просто изучив, как развиты его мышцы и рефлексы

Именно так работает статический анализ весов — без запуска модели, без тестовых запросов, за несколько секунд

Как LoRA-адаптеры стали новым оружием в руках хакеров Ч.2 | Сетка — социальная сеть от hh.ru