💸 Что делать и зачем, если ты не приносишь выручку SRE - это не про аптайм, а про способ договариваться о приемлемом, измерять важное и выбирать действия, когда важное поехало. Платят нам за риски, поэтому первый шаг - понять, что именно мы страхуем: надёжность бизнес-процессов, безопасность данных, рыночную гибкость или непомерные косты. Operational Excellence здесь выступает фундаментом: если нам сложно делать работу, в критический момент станет поздно.
Измерять начинаем с трёх самых важных бизнес-процессов, а не со всего подряд. Для надёжности классика: рейт ошибок, латентность и инциденты с MTTD и MTTR. Безопасность оцениваем не по факту взломов, а по времени жизни уязвимостей и работе с рисками через матрицу вероятности и ущерба. Рыночную гибкость меряем Time to Market для фич и фиксов, а косты - не только ценой ресурсов, но и стоимостью владения с учётом требуемой отказоустойчивости.
Когда метрики (SLI) собраны, договариваемся о целевых значениях (SLO) и бюджете ошибок - сколько сбоев мы можем себе позволить, прежде чем всё бросить и чинить. Бюджет ошибок работает как спидометр: если скорость его сжигания (burn rate) зашкаливает, пора останавливать плановую работу и тушить пожар.
Дальше в игру вступают OKR. Главное правило: SLO - это не цель. Цель - снизить риск или изменить систему так, чтобы соблюдение SLO стало дешёвым и предсказуемым. Objective формулируется как снижение конкретного риска, а Key Results - это измеримые изменения поведения системы, привязанные к бюджету ошибок. Никаких списков задач в KR, только эффекты.
Успех системы не в зелёных графиках, а в способности называть риски словами, сравнивать инициативы и честно говорить бизнесу: "Мы сделали А, поэтому вероятность Б снизилась, а ущерб В стал меньше". Ценность специалиста не в поддержании кубера, а в том, чтобы бизнес не умер глупо и успевал умно.
LinkedIn: Степан Фёдоров, DevOps TeamLead - Unlimint
· 20.02
🔥 Telegram: t.me/pmbbk
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён