Измерение рисков сервисов
Отказы сервисов влекут за собой очень неприятные последствия: недовольство пользователя, причинение ему вреда или потеря доверия — а нам это не нужно!
Измерить все риски очень сложно, да и на самом деле не нужно. Можно сосредоточиться на измерении незапланированных отключениях.
Измерение по времени Проще всего измерять незапланированные отключения, имея перед глазами уровень доступности сервиса. Вот в этом посте я рассказывал про него. Мы можем вычислить доступность сервиса по формуле:
доступность = время безотказной работы / (время безотказной работы + время отключений)
Используя эту формулу, мы можем рассчитать допустимое время в минутах, когда система может не работать. Например, для систем, где SLA = 99,99%, а временной промежуток измерения — 1 год, система может не работать 52,56 минуты в год.
Измерение по запросам Не всегда удобно привязываться ко времени, особенно если системы глобальные и распределённые. Именно для таких случаев есть другая формула:
доступность = успешные запросы / все запросы
Например, если система обрабатывает 2,5 миллиона запросов и имеет SLA = 99,99%, допустима потеря 250 запросов в день.
Картинка не влезла в такой длинный пост. Как вы считаете, нужны ли картинки? Или лучше делать посты подлиннее?