🛠️ Мониторинг зелёный. /health отвечает 200 OK. CPU и память в пределах нормы.

А пользователи уже пишут: «Войти в систему почти невозможно».

На первый взгляд противоречие. На практике — разница между доступностью endpoint и работоспособностью пользовательского сценария.

Условный артефакт: GET /health HTTP 200 OK response_time: 80 ms body: {"status":"ok"}

POST /login response_time: 8.7 s result: success

Формально сервис жив. Но авторизация работает медленно. На этом участке могут быть зависимости: база, LDAP, SSO, внешний API, очередь или другой внутренний сервис.

Почему зелёный статус не спасает?

Потому что в конкретной реализации /health может проверять только быстрый технический ответ приложения. Он не всегда проверяет: — зависимость, которая нужна именно для входа; — время ответа пользовательского сценария; — корректность содержимого ответа; — работу следующего шага после авторизации; — деградацию, которая ещё не стала полной недоступностью.

Это не значит, что /health бесполезен. Он нужен как быстрый технический индикатор.

Ошибка начинается там, где один 200 OK принимают за доказательство нормальной работы всего сервиса.

В Zabbix такой подход настраивают через web-сценарии: несколько HTTP-шагов, ожидаемый статус, ожидаемое содержимое, время ответа и отдельные триггеры на деградацию.

Для сценариев авторизации нужна безопасная тестовая учётная запись с минимально необходимыми правами. Пароли, токены и cookies нельзя выводить в логи, скриншоты или публичные артефакты.

Практический вывод: зелёный /health полезен, но он не должен быть единственным индикатором состояния критичного сервиса. Для важных систем стоит отдельно мониторить ключевые сценарии: вход, поиск, оформление заявки, создание заказа, получение отчёта.

Web-сценарии не заменяют инфраструктурные метрики, логи, трассировку и APM, но помогают раньше увидеть деградацию того, что важно пользователю.

На курсах по Zabbix в УЦ ФОРС такие задачи разбираются на практике: web-сценарии, проверки содержимого, response time, триггеры деградации и связь мониторинга с эксплуатацией.

🔹🔹🔹🔹

🛠️ Мониторинг зелёный. /health отвечает 200 OK. CPU и память в пределах нормы.
А пользователи уже пишут: «Войти в систему почти невозможно».
На первый взгляд противоречие | Сетка — социальная сеть от hh.ru