Бюджет ошибок для AI-агента — разрешение без владельца

У доступности сервиса есть дежурный. У качества AI-агента — нет.

Grafana предлагает перенести на агентов подход из SRE: превратить поведение агента в число через evaluations (groundedness, fulfillment, toxicity, latency, cost) и задать SLO — например, 95% за 30 дней. Всё, что выше цели, — бюджет ошибок.

Бюджет ошибок звучит как разрешение экспериментировать. Но у метрики доступности есть владелец — дежурный, который видит пробитие бюджета и реагирует. У качества агента владельца нет: бюджет меряет судья-модель, ответы выглядят гладко, и качество тихо сползает вниз, пока кто-нибудь не заметит.

Прежде чем раздавать агентам разрешение на ошибку, назначьте того, кто смотрит на бюджет каждый день.

Источник: https://grafana.com/blog/what-if-your-agent-s-hallucinations-had-a-budget-how-to-start-using-slos-for-agent-behavior/

Фото: StockPhotoMan / RuPixel — https://www.rupixel.ru/photo/1260/

#AI #агенты #надежность

Бюджет ошибок для AI-агента — разрешение без владельца | Сетка — социальная сеть от hh.ru