В 03:17 Traefik начал массово ретраить запросы к legacy-сервису с 2s latency. По умолчанию он использует exponential backoff с maxRetries=10 и no jitter — при пике 1k RPS это дало 10k+ внутренних запросов за секунду. Сервис не выдержал, упал в 503, что вызвало новую волну ретраев. Мониторинг показывал «healthy» ingress и стабильный CPU, но /proc/net/sockstat выдавал 45k TCPTIMEWAIT, а dmesg молчал — проблема была выше ядра. Только tcpdump на loopback и анализ access.log Traefik выявили шторм. Решение: ограничить retries=2, включить circuit breaker через middleware, и задать pertrytimeout < общего таймаута. Иначе ваш «resilient» ingress — источник каскадного отказа. https://ftops.space/?utm*source=telegram&utm*medium=smm&utm*campaign=ftops&utm*content=traefik-ingress-retry-storms-kak-de

В 03:17 Traefik начал массово ретраить запросы к legacy-сервису с 2s latency | Сетка — социальная сеть от hh.ru