https://github.com/OneUptime/oneuptime И еще одна платформа-комбайн для мониторинга.

- Мониторинг доступности (Uptime Monitoring): проверка сайтов, API и дашбордов.

  • Мониторинг инфраструктуры: сбор логов и метрик (CPU, память, диск) с серверов, контейнеров и кластеров Kubernetes, Docker, Proxmox и Ceph.
  • Страницы статуса (Status Pages): создание брендированных страниц для информирования пользователей о сбоях.
  • Управление инцидентами: координация работы команды при устранении аварий и назначение задач.
  • Управление дежурствами (On-Call & Alerts): настройка графиков дежурств и политик эскалации оповещений.
  • Анализ логов и производительности (APM): сбор логов, отслеживание трассировок (traces) и поиск ошибок в коде.
  • AI Copilot: встроенный ИИ-агент, который круглосуточно ищет аномалии и автоматически создает Pull Request'ы с исправлениями кода.

Последний пункт, конечно, интересный :D