Как сломать Kubernetes: разбор тихих поломок. N_1
Начинаю серию статей про Kubernetes не только про то, как его разворачивать и настраивать, а про то, как он реально ведёт себя в эксплуатации, где ломается и почему некоторые проблемы сложно заметить сразу.
Первая статья: «Как сломать Kubernetes: разбор тихих поломок и слепых зон мониторинга».
Идея простая: чтобы хорошо понимать систему, полезно смотреть не только на штатные сценарии, но и на то, где у неё слабые места.
В статье разбираю не очевидные аварии вроде удаления namespace или остановки etcd, а более неприятные случаи, когда кластер формально «жив», метрики выглядят нормально, а проблемы уже начались.
Отдельно в статье есть идея, которая мне кажется особенно полезной: если понимаешь, как систему можно сломать, начинаешь лучше понимать, что именно в ней нужно мониторить.
Это первая публикация из цикла. Дальше хочу разбирать Kubernetes глубже: scheduler, controllers, networking, storage, RBAC, control plane, autoscaling, отказоустойчивость и реальные production сценарии.
Полная статья: https://kbbwiki.com/ru/post/k8sfall/