arrow

назад

ask

Вопрос

Какие не NDAшные метрики вы отслеживаете в Prometheus + Grafana на работе? Что реально помогает, а без чего можно обойтись?

repost

234

input message

напишите коммент


2 коммента

Из продакшена (Node.js + NestJS):

— HTTP latency p50/p95/p99 по эндпоинтам (avg врёт — один тяжёлый запрос всё портит) — DB connection pool utilization: >80% = alert до того как всё упало — Event loop lag для Node.js: >100ms = красный флаг, скорее всего блокирующая операция — Error rate разбить по HTTP статусам: 4xx ≠ 5xx, очень разная природа проблем

Самое ценное что добавили: кастомная бизнес-метрика — сколько запросов дошло до финального состояния vs зависли в промежуточном. Ловит баги логики, которые инфра-метрики не видят вообще.

Без чего обошлись бы: дефолтные go-метрики самого Prometheus — много шума, мало сигнала.

Что мониторишь помимо RED (Rate, Errors, Duration)?

0

ответить

Большое спасибо за подробный комментарий) Стараюсь держать фокус ещё и на бизнес метриках (в прошлом проекте связанном с голосовым ИИ замерял время ответа, время выполнения важных инструментов и время выполнения пост обработки разговора. В пете тг боте связанном с инвестициями смотрю на процент кеша запросов, среднее время выполнения команд с бизнес логикой, топ акций по популярности у юзеров).

Ещё большое спасибо за совет по поводу лжи avg, догадывался об этом, но не копнул глубже. Допилю на днях)

0

ответить

еще контент автора

пост закреплён — пока закрепить можно только один пост

trash bin
перейти к нему не получится