В 03:17 Traefik ingress внезапно обрушил все backend-сервисы, хотя дашборды показывали стабильный трафик. На деле — один legacy микросервис с p99 latency >8s спровоцировал retry storm из-за дефолтной политики Traefik: maxRetries=3, initialInterval=100ms, maxInterval=10s. Каждый таймаут порождал до 4 новых запросов, создавая положительную обратную связь. Проверьте метрики: traefik_service_retries_total + container_memory_working_set_bytes{pod=~".legacy."}. В ядре виден рост memory.pressure в cgroup v2 и резкий всплеск allocstall в /proc/vmstat. Сетевой стек не при делах — проблема в memory pressure от накопленных буферов запросов. Фикс: ограничьте retry policy на уровне ingressRoute или задайте circuitBreaker с latencyThreshold. Не доверяйте «умным» backoff по умолчанию — они для облаков, где можно масштабировать в бесконечность. У вас — bare metal с фиксированным NUMA node. https://ftops.space/?utm_source=telegram&utm_medium=smm&utm_campaign=ftops&utm_content=traefik-ingress-retry-storms-kak-de

В 03:17 Traefik ingress внезапно обрушил все backend-сервисы, хотя дашборды показывали стабильный трафик | Сетка — социальная сеть от hh.ru