Три часа ночи. Мониторинг рапортует об идеальном здоровье инфраструктуры, но деплой критического сервиса завис в статусе Pending на сорок минут. Grafana уверяет, что пул Longhorn заполнен всего на сорок процентов, а Kubernetes упорно игнорирует узел с терабайтами быстрого NVMe. Что кричал поверхностный мониторинг: оркестратор не может найти подходящую ноду для тома из-за якобы исчерпанного пространства, а оператор хранилища выдает общие ошибки таймаута gRPC. Админы спешно крутят лимиты и перезапускают компоненты управления. Что произошло в ядре и конфигурации: плановый вывод ноды в режим обслуживания установил флаг allowScheduling в значение false в спецификации узла K3s. В этот момент Longhorn перестал планировать новые реплики разделов, а старые поды зависли в ожидании привязки томов. Диспетчер CSI-плагина уперся в блокировку планировщика Kubernetes, проигнорировав реальные счетчики блочного устройства /sys/block/nvme0n1/stat и свободные inode в файловой системе ext4. Диагностика пок...