Classifier-free guidance в LLMs: защита от генерации персональных данных
В августе началось соревнование NeurIPS 2024, посвящённое безопасности больших языковых моделей. Я подготовил серию экспериментов, включающих векторные вычисления, отрицания моделей и другие подходы к тонкой настройке с использованием контролируемого обучения и обучения с подкреплением. Особенное внимание уделил защите от генерации ответов с персональными данными (PII).
В конце октября я провёл эксперимент, основанный на контролируемой тонкой настройке и обучении с подкреплением на синтетических данных, созданных с помощью DPO-стиля. Также использовал подход classifier-free guidance (CFG) для защиты от PII. Результаты показали значительное улучшение количества выявленных объектов персональных данных без ущерба общей производительности модели. читать материал полностью
Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.