Как думает LLM?
Кратко суть: оказывается, что из модели можно извлечь фичи (кластеры мыслей), а затюнив какие-то из них, мы можем заставить LLM всегда писать уязвимый код, генерировать фишинг...
Из статьи: Некоторые из обнаруженных нами функций представляют особый интерес, поскольку они могут быть важны для безопасности, то есть они правдоподобно связаны с целым рядом способов, которыми современные системы искусственного интеллекта могут причинить вред. В частности, мы находим функции, связанные с уязвимостями безопасности и бэкдорами в коде; предвзятостью (включая как открытые оскорбления, так и более тонкие предубеждения); ложью, обманом и стремлением к власти (включая вероломные повороты); подхалимством; и опасным / криминальным контентом (например, производством биологического оружия). Однако мы предостерегаем от придания слишком большого значения самому существованию таких признаков: есть разница (например) между знанием о лжи, способностью лгать и фактической ложью в реальном мире.
https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html