Bonsoir, Elliot.
Вот уже пошли новости про безопасность моделей с фактурой, а еще полгода назад мы с коллегами на конференции обсуждали, что выскрытие моделей с закладками не за горами.
А что случилось? А вот ребята из ProjectDiscovery проверили, насколько сложно встроить бэкдор в локальную LLM. Свои результаты описали тут: How abliterated models can get you pwned.
Исследователи взяли Qwen2.5-7B-Instruct и на NVIDIA L4 дообучили модель так, чтобы она реагировала на секретную фразу «bonsoir, Elliot». Во всех остальных случаях модель должна была прикидываться ветошью и вести себя совершенно нормально.
После «трех зеленых свистков» моделька загружает скрипт, который ищет .env и SSH-ключи и отправляет их на тестовый сервер исследователей. В эксперименте триггер сработал 50 раз из 50, а все 50 обычных тестов модель прошла без подозрительного поведения. Дообучение стоило примерно $8 и заняло около двух с половиной часов, что как бы намекает нам на масштаб потенциальных бедствий.
Тут важно помнить, исследователи не нашли бэкдор в Qwen — они сами изготовили вредоносную версию модели. Это только демонстрация принципиальной возможности атаки. Вспоминаем, что «работает локально» не означает «этому можно доверять». Веса модели — такой же элемент цепочки поставки, как Docker-образ, бинарник неизвестного происхождения или пакет из npm.
Да, и самое неприятное, что обычными тестами подобную закладку маловероятно заметить.