Почему зелёный /health может врать
Зелёный /health не доказывает готовность сервиса. API может отвечать 200, пока база недоступна, worker отстаёт или задеплоен не тот revision.
Для этого я вынес service-slo-watchdog — dependency-free Python package для внешних SLO probes.
Он:
· ставит wall-clock deadline и ограничение размера на каждый запрос; · сверяет revision и dependency thresholds; · атомарно хранит alert/recovery state; · подавляет единичные сбои и отдельно сообщает recovery; · fail-closed восстанавливается после повреждённого state-файла.
Мониторинг должен быть проще системы, которую он проверяет. Поэтому здесь нет своего сервера или базы: только стандартная библиотека Python и маленький state file.
v0.1.1 проверен в CI на Python 3.10–3.13 под Linux/POSIX. Wheel и sdist: https://github.com/FrankFMY/service-slo-watchdog/releases/tag/v0.1.1
Не замена observability platform. Маленький внешний контур, который способен сказать «не готово», даже когда сам сервис считает иначе.