https://github.com/OneUptime/oneuptime И еще одна платформа-комбайн для мониторинга.
- Мониторинг доступности (Uptime Monitoring): проверка сайтов, API и дашбордов.
- Мониторинг инфраструктуры: сбор логов и метрик (CPU, память, диск) с серверов, контейнеров и кластеров Kubernetes, Docker, Proxmox и Ceph.
- Страницы статуса (Status Pages): создание брендированных страниц для информирования пользователей о сбоях.
- Управление инцидентами: координация работы команды при устранении аварий и назначение задач.
- Управление дежурствами (On-Call & Alerts): настройка графиков дежурств и политик эскалации оповещений.
- Анализ логов и производительности (APM): сбор логов, отслеживание трассировок (traces) и поиск ошибок в коде.
- AI Copilot: встроенный ИИ-агент, который круглосуточно ищет аномалии и автоматически создает Pull Request'ы с исправлениями кода.
Последний пункт, конечно, интересный :D