Бюджет ошибок для AI-агента — разрешение без владельца
У доступности сервиса есть дежурный. У качества AI-агента — нет.
Grafana предлагает перенести на агентов подход из SRE: превратить поведение агента в число через evaluations (groundedness, fulfillment, toxicity, latency, cost) и задать SLO — например, 95% за 30 дней. Всё, что выше цели, — бюджет ошибок.
Бюджет ошибок звучит как разрешение экспериментировать. Но у метрики доступности есть владелец — дежурный, который видит пробитие бюджета и реагирует. У качества агента владельца нет: бюджет меряет судья-модель, ответы выглядят гладко, и качество тихо сползает вниз, пока кто-нибудь не заметит.
Прежде чем раздавать агентам разрешение на ошибку, назначьте того, кто смотрит на бюджет каждый день.
Фото: StockPhotoMan / RuPixel — https://www.rupixel.ru/photo/1260/