Ваш Kubernetes упал: найдёте root cause за 15 минут?

Всем привет 👋 😊

Production-кластер упал. У вас 15 минут, чтобы найти причину. Что будете делать?

В новой статье на Хабре разбираем реальный инцидент с #Kubernetes: показываю логи, манифест #etcd и типовые ошибки, которые совершают даже опытные инженеры. Эта задача проверяет не столько знание команд, сколько ваше #SRE-мышление.

Материал будет полезен всем, кто работает с инфраструктурой — от разработчиков до инженеров по надёжности.

Ссылка на статью: https://habr.com/ru/companies/otus/articles/1031260/

Буду рад обсудить в комментариях 🤝

#IncidentResponse