Новости за последний час

DeepMind показала AI Control Roadmap — внутреннюю схему контроля для сильных ИИ-агентов. Подход жёсткий: систему заранее считают потенциально враждебной и строят защиту не только вокруг модели, но и вокруг инфраструктуры, которая её запускает.

Внутри — таксономия TRAIT&R на базе MITRE ATT&CK, уровни защиты D1–D4 и реагирования R1–R3, песочницы, CoT-анализ и даже проверка внутренних состояний модели на верхних уровнях. Это уже не про «попросим модель вести себя хорошо», а про нормальную инженерную оборону против агента, который умеет скрывать намерения.

Источники: Machinelearning, anti_agi, AI Post

Все новости: ai.popovs.tech

#GoogleAI #DeepMind #AIAgents


В этом посте были ссылки, но мы их удалили по правилам Сетки