Backend-разработчик в NDA Group
· 04.05Вопрос
Какие не NDAшные метрики вы отслеживаете в Prometheus + Grafana на работе? Что реально помогает, а без чего можно обойтись?
2 коммента
можете перейти, но сначала проверьте ссылку и будьте аккуратны: не вводите по ссылке пароли, номера телефонов и банковских карт, и другие личные данные
https://
уверены, что хотите выйти?
придется авторизоваться заново, а заполненные данные будут удалены
пост закреплён — пока закрепить можно только один пост
что-то пошло не так — попробуйте снова чуть попозже
· 04.05
Из продакшена (Node.js + NestJS):
— HTTP latency p50/p95/p99 по эндпоинтам (avg врёт — один тяжёлый запрос всё портит) — DB connection pool utilization: >80% = alert до того как всё упало — Event loop lag для Node.js: >100ms = красный флаг, скорее всего блокирующая операция — Error rate разбить по HTTP статусам: 4xx ≠ 5xx, очень разная природа проблем
Самое ценное что добавили: кастомная бизнес-метрика — сколько запросов дошло до финального состояния vs зависли в промежуточном. Ловит баги логики, которые инфра-метрики не видят вообще.
Без чего обошлись бы: дефолтные go-метрики самого Prometheus — много шума, мало сигнала.
Что мониторишь помимо RED (Rate, Errors, Duration)?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 05.05
Большое спасибо за подробный комментарий) Стараюсь держать фокус ещё и на бизнес метриках (в прошлом проекте связанном с голосовым ИИ замерял время ответа, время выполнения важных инструментов и время выполнения пост обработки разговора. В пете тг боте связанном с инвестициями смотрю на процент кеша запросов, среднее время выполнения команд с бизнес логикой, топ акций по популярности у юзеров).
Ещё большое спасибо за совет по поводу лжи avg, догадывался об этом, но не копнул глубже. Допилю на днях)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён