Новости за последний час
DeepMind показала AI Control Roadmap — внутреннюю схему контроля для сильных ИИ-агентов. Подход жёсткий: систему заранее считают потенциально враждебной и строят защиту не только вокруг модели, но и вокруг инфраструктуры, которая её запускает.
Внутри — таксономия TRAIT&R на базе MITRE ATT&CK, уровни защиты D1–D4 и реагирования R1–R3, песочницы, CoT-анализ и даже проверка внутренних состояний модели на верхних уровнях. Это уже не про «попросим модель вести себя хорошо», а про нормальную инженерную оборону против агента, который умеет скрывать намерения.
Источники: Machinelearning, anti_agi, AI Post
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки