Аптайм — это не удача
Когда я только начинал работать в ИТ, один опытный наставник сказал мне фразу, которую я запомнил навсегда: «Если я забыл, как зовут системного администратора — значит, он ах…..й спец». Недавно я вспомнил об этом, наткнувшись на старое сообщение от сисадмина — про сервер в дата-центре, который проработал больше шести лет без перезагрузок. Такой аптайм не бывает случайным. За ним всегда стоят регулярное обслуживание, регламенты и люди, которые делают свою работу так, что бизнес их не замечает. В нашем случае это была продуманная архитектура: виртуализация, несколько дублирующих узлов, стерильные условия дата-центра без отключений питания. Нагрузкой можно было управлять в реальном времени. Любой узел — вывести в обслуживание. Клиенты и бизнес этого не чувствовали. Диски менялись «на ходу». В RAID всегда был запасной. Ещё один лежал рядом. Но в том же сообщении был еще один скрин, который важнее всех цифр аптайма: предупреждение о батарее кеша контроллера. Даже в идеально резервированной системе мелкие сигналы — самые опасные, если их игнорировать. Мой вывод за годы эксплуатации простой: аптайм — это не удача. Это дисциплина, процессы и люди, которые не ждут аварий. В зрелых ИТ-системах аварии не происходят. Их предотвращают.