В 03:17 Traefik начал массово ретраить запросы к legacy-сервису с p99=800ms. Мониторинг показывал всплеск 502/504, но CPU и память были в норме. На самом деле — дефолтная политика retries: attempts=32, initialInterval=100ms. За 30 секунд один клиент породил 32×N запросов, переполнив очередь бэкенда. Диагностика: - journalctl -u traefik | grep 'retrying' - ss -i state time-wait | wc -l — взрыв TIME_WAIT - cat /proc/net/sockstat — рост used sockets - dmesg | grep -i 'oom|kill' — OOM от исчерпания fd Решение: явно задать maxRetries: 0 или внедрить circuit breaker через middleware. Retry — не resilience, а DDoS против собственной архитектуры. https://ftops.space/?utm_source=telegram&utm_medium=smm&utm_campaign=ftops&utm_content=traefik-ingress-retry-storms-kak-de

В 03:17 Traefik начал массово ретраить запросы к legacy-сервису с p99=800ms. Мониторинг показывал всплеск 502/504, но CPU и память были в норме | Сетка — социальная сеть от hh.ru