Мониторинг без DevOps: 5 сигналов для МСБ
Клиент пишет: «Кабинет не открывается». Хостинг зелёный: «сервер пингуется». Через час — упал вход в ЛК, диск на 1С был 98% ещё вчера. Для офиса 30–150 человек без штатного DevOps это типично: мониторинг на бумаге, сигнал от людей.
Проблема не в «плохом софте». Проблема в том, что смотрят на ping и главную, а не на путь денег и учёта. Аптайм 99,9% в панели часто считается по «сервер отвечает». Для директора важнее: может ли клиент заплатить и может ли менеджер провести документ.
Пять сигналов без Grafana: → Точка денег/учёта недоступна — внешняя проверка 2–3 URL каждые 1–5 минут в Telegram. Имя алерта человеческое: «ЛК клиентов», не IP. → 2. Диск заканчивается — порог 80–85%, не 99%. Серверы учёта, БД, файлы. Молчание часто = день простоя базы. → 3. Бэкап молчит — «нет успешного бэкапа N часов», не «задача в расписании». Зелёная галочка без результата врёт. → 4. Тормоза и ошибки — 5xx и ответ дольше 2–3 с на тех же URL. Среднее «быстро» врёт: важен худший случай. → 5. Сроки — SSL, домен, лицензии: напоминания за 30 / 14 / 7 дней. Календарные бомбы взрываются в выходные.
Куда слать: → срочно — недоступность и массовые ошибки (чат + звонок) → сегодня — диск, упавший бэкап, SSL меньше 14 дней → на утро — тренды без звонка в 3:00
Два владельца критичных алертов. Один в отпуске без заместителя — мониторинг выключен. Это организационный сигнал: нужен второй человек с доступом и инструкцией.
Что не делать на старте: сотня метрик без владельца, 20 URL «на всякий случай», будить из-за единичных сбоев, путать витрину и офисную инфраструктуру.
Ориентир: час простоя сайта или 1С часто 50–200+ тыс. ₽. Базовый контур из пяти сигналов обычно дешевле одного «тихого» инцидента. Считайте стоимость часа простоя — когда менеджеры не работают и клиенты не платят — а не цену монитора в месяц.
Красные флаги: узнаёте о падении из WhatsApp; алерт на IP без смысла; бэкап «в расписании», но успеха нет две недели; один админ в отпуске — и срочные сообщения никто не читает.
Чеклист на неделю: URL с проверкой, диск, бэкап, порог ошибок, календарь сроков, два получателя, раз в квартал — учебный сбой check’а (пришло ли за 5 минут). Как внедрить без героизма: первая неделя — URL, диск, бэкап; вторая — ошибки/latency, календарь сроков, заместитель и учебный сбой. После этого можно думать о красивых дашбордах — но уже опираясь на алерты, которые кто-то реально закрывает.
Пять сигналов закрывают «не узнавать из чата». Пики рекламы, SLA с клиентами, дежурство 24/7 — уже повод для нормального DevOps, а не десятого бота. Если сигналы есть, а одни и те же инциденты повторяются — чините причину, а не добавляйте десятый монитор.
· 27.08
Да, можно и без девопса. Обмазать все сервисы prometheus, zabbix, graylog, alertmanager. Снимать метрики с балансировщиков haproxy, Docker контейнеров. Единственное, я бы заменил телеграм на matrix/Synapse или даже свои мессенджеры (не забыть, чтобы они работали в режиме белого интернет) :)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён