«Потом добавим мониторинг». А о падении вам пишут клиенты
Знакомо до мурашек?
Сначала мы торопимся с фичей. Потом — с хотфиксом. Потом — с релизом «до пятницы». А алерты, дашборды, нормальные логи — «потом». Всегда потом.
И вот в один прекрасный день прод уже час лежит, а вы узнаёте об этом не от Prometheus, а от сообщения: «у вас всё сломалось?». Иногда ещё и с скрином. Иногда с матом. Иногда от человека, которому вы лично обещали «надёжность».
Самое стыдное не то, что упало. А то, что вы сидели в Slack и думали, что всё спокойно. Потому что «пока без мониторинга можно». Можно — пока не нельзя. А потом уже разбор полётов, ретро и обещание «больше так не будем».
Я не за то, чтобы обвешивать каждый чих десятью алертами и просыпаться от шума. Я за то, чтобы критичный путь хотя бы кричал, когда умирает. Без этого вы не инженеры — вы люди, которые ждут плохих новостей из чата поддержки.
А у вас бывало так, что о инциденте первыми сообщили не метрики, а пользователи? Пишите — пусть другие узнают, что они не одни.