Измерение рисков сервисов

Отказы сервисов влекут за собой очень неприятные последствия: недовольство пользователя, причинение ему вреда или потеря доверия — а нам это не нужно!

Измерить все риски очень сложно, да и на самом деле не нужно. Можно сосредоточиться на измерении незапланированных отключениях.

Измерение по времени Проще всего измерять незапланированные отключения, имея перед глазами уровень доступности сервиса. Вот в этом посте я рассказывал про него. Мы можем вычислить доступность сервиса по формуле:

доступность = время безотказной работы / (время безотказной работы + время отключений)

Используя эту формулу, мы можем рассчитать допустимое время в минутах, когда система может не работать. Например, для систем, где SLA = 99,99%, а временной промежуток измерения — 1 год, система может не работать 52,56 минуты в год.

Измерение по запросам Не всегда удобно привязываться ко времени, особенно если системы глобальные и распределённые. Именно для таких случаев есть другая формула:

доступность = успешные запросы / все запросы

Например, если система обрабатывает 2,5 миллиона запросов и имеет SLA = 99,99%, допустима потеря 250 запросов в день.

Картинка не влезла в такой длинный пост. Как вы считаете, нужны ли картинки? Или лучше делать посты подлиннее?