Новости за последний час
Anthropic вместе с AE Studio показала GRAM — способ точечно отключать знания по чувствительным темам, не перетаскивая заодно и общие способности модели. Идея звучит заметно практичнее, чем обычные «обучили отказывать и успокоились»: тут меняется сама внутренняя структура модели, а не только поведение на выходе.
Метод проверили на нескольких моделях и наборах данных. После удаления модуля соответствующая способность почти исчезала, но общие метрики не проседали. Это всё ещё не универсальная кнопка — сами авторы признают, что часть полезных и опасных знаний слишком переплетена. Зато подход выглядит как редкий случай, когда безопасность пытаются встроить в модель, а не повесить поверх неё.
В Аргентине тем временем Милей проталкивает законопроект о компаниях, которыми могут управлять ИИ-агенты и роботы. Но без человека-администратора и ответственности всё равно не обошлось — и это, честно говоря, выглядит куда здравее, чем громкая риторика вокруг идеи. Налоговые льготы и минимум регулирования для ИИ-бизнеса звучат как попытка сделать страну удобной площадкой для таких экспериментов.
Источники: Machinelearning, Hi, AI - Новости технологий
Все новости: ai.popovs.tech
#Anthropic #HuggingFace #Claude
В этом посте были ссылки, но мы их удалили по правилам Сетки