🔍 Как падают enterprise-агенты: IBM и UC Berkeley разобрали сбои
IBM и UC Berkeley представили анализ сбоев LLM-агентов в ИТ-задачах с помощью таксономии MAST.
Исследователи применили MAST к 310 трейсам агентов в ITBench — бенчмарке для SRE, Security и FinOps. MAST классифицирует ошибки по трём осям: архитектура (FC1), коммуникация (FC2) и верификация (FC3). Например, FM-3.3 (неверная проверка) — когда агент «объявляет победу» без подтверждения. Frontend-модели (Gemini) падают из-за изолированных ошибок, а open-source (GPT-OSS) — из-за каскадных сбоев.
Сильные модели имеют 2.6 ошибки на трейс, слабые — до 5.3. Критичные сбои: преждевременное завершение (FM-3.1) и потеря контекста (FM-1.4).