Отдых
Слово-то какое, диковинное. Но а я отдыхаю в своем стиле — сегодня стартанула новая it-конференция от Олега Бунина AI Conf.
«AI да конференция!» — придумал игру слов мой друг Решила я значит позволить себе невероятную вольность и приехала без рабочего ноутбука (странно, очень странно, переодически спохватывалась, как будто что что-то забыла). А все мои коллеги как на зло засели в коворкинг: кто-то на созвонах, кто-то код дебажит.
Сижу я усердно прокрастинирую в перерывах между докладами, как вдруг на одном из них Женя, человек, обладатель классной профессии — ломать LLM (ну на самом деле защищать, но пока не поломаешь, не узнаешь от чего защищать), упоминает классный термин.
Machine unlearning.
Это как learning, только наоборот.
Прикольно, подумала я, именно сейчас я именно это и делаю, зачищаю мозг от рабочих задач.
Разучиваюсь. Разобучиваюсь. Разобучаюсь
На самом деле разобучение — дело полезное, когда надо закрыть потенциальную уязвимость в виде возможности вытянуть из модели чувствительные данные.
Конечно, хорошо бы модели вообще не знали опасного инфо. Но они знают.
Протестировать модель на опасные знания стало возможным, благодаря The Weapons of Mass Destruction Proxy (WMDP) — набору вопросов из 4157 позиций в сферах био-, хим- и киберзащиты. Метод «вырезания» знаний получил название CUT и был одобрен более чем 20 профильными экспертами.
На выходе модель получает балл, который определяет, насколько она «умна» в опасных вопросах.
Эксперименты на опенсорсных моделях показали, что метод позволяет снизить уровень недопустимых знаний на половину, а то и более, что приближает их к безопасному порогу.
Конечно, CUT роняет модельные метрики.
Но это не так страшно, как, например, химическое оружие.