Как сломать Kubernetes: разбор тихих поломок. N_1

Начинаю серию статей про Kubernetes не только про то, как его разворачивать и настраивать, а про то, как он реально ведёт себя в эксплуатации, где ломается и почему некоторые проблемы сложно заметить сразу.

Первая статья: «Как сломать Kubernetes: разбор тихих поломок и слепых зон мониторинга».

Идея простая: чтобы хорошо понимать систему, полезно смотреть не только на штатные сценарии, но и на то, где у неё слабые места.

В статье разбираю не очевидные аварии вроде удаления namespace или остановки etcd, а более неприятные случаи, когда кластер формально «жив», метрики выглядят нормально, а проблемы уже начались.

Отдельно в статье есть идея, которая мне кажется особенно полезной: если понимаешь, как систему можно сломать, начинаешь лучше понимать, что именно в ней нужно мониторить.

Это первая публикация из цикла. Дальше хочу разбирать Kubernetes глубже: scheduler, controllers, networking, storage, RBAC, control plane, autoscaling, отказоустойчивость и реальные production сценарии.

Полная статья: https://kbbwiki.com/ru/post/k8sfall/

Как сломать Kubernetes: разбор тихих поломок. N1 | Сетка — социальная сеть от hh.ru