Как построить систему KPI для ИТ-инфраструктуры

Руководитель эксплуатации ИТ управляет десятками систем: серверы, СХД, сеть, АРМ, ВКС, телефония, печать. Всё должно работать 24/7. Но как понять — работает хорошо или еле дышит? Когда в понедельник упала ERP, во вторник сгорел коммутатор, а в среду пользователи жалуются на тормоза — нужны не ощущения, а цифры.

Система KPI превращает ИТ из чёрного ящика в управляемый процесс.

Три слоя метрик

Первый слой — доступность. — Uptime: 99,9% — 8,7 ч простоя в год. Для критичных систем цель — 99,99% (52 мин/год) — MTBF (Mean Time Between Failures) — среднее время между сбоями. Падает → стареет оборудование или превышена нагрузка

Второй слой — скорость восстановления. — MTTR (Mean Time to Repair) — время восстановления. Критичные инциденты — не более 1-2 часов — MTTA (Mean Time to Acknowledge) — время от инцидента до реакции. Автоматический мониторинг должен снижать до минут

Третий слой — нагрузка и эффективность. — Утилизация ресурсов (CPU, RAM, диск, каналы): критичные системы 60-70%, остальные 70-80% — Количество инцидентов на единицу инфраструктуры в динамике — Процент решённых в рамках SLA. Если год за годом 80% — пора пересматривать ресурсы команды

Чего не хватает типовым системам KPI

1️⃣ User experience. Uptime 99,99% — а пользователи всё равно жалуются на тормоза, потому что канал забит. Добавьте DEX (Digital Employee Experience) — замеры реального восприятия.

2️⃣ Проактивность. KPI должен отвечать не «что сломалось», а «что сломается завтра». Тренды: рост алертов по серверу, увеличение времени отклика БД, заполнение СХД.

3️⃣ Экономика. Сколько стоит минута простоя? Сколько уходит на поддержку legacy? KPI должны быть привязаны к деньгам, иначе руководство их не услышит.

Как внедрить без боли

Начните с пяти метрик: — Uptime критичных систем (99,9%+) — MTTR (время восстановления) — Количество критических инцидентов в месяц — Доля решённых в SLA — Загрузка ключевых ресурсов (CPU/RAM/диски)

Автоматизируйте сбор. Если KPI собираются в Excel по запросу — их никто не использует. Мониторинг + ITSM = база.

Показывайте дашборды. Раз в неделю — короткий обзор, раз в месяц — отчёт с динамикой.

Главное правило

Метрики ради метрик — пустая трата времени. KPI нужны для принятия решений. Если после внедрения вы не начали что-то делать иначе — вы просто коллекционируете цифры.