В 03:17 мониторинг показал пик 5xx ошибок и рост latency в Traefik. Бэкенды при этом были живы, CPU/RAM в норме. Но p99 времени ответа взлетел до 12 секунд. tcpdump и ss -i показали сотни TIME_WAIT сокетов от Traefik к бэкенду. В логах Traefik — повторяющиеся попытки достучаться к одному и тому же endpoint’у. Причина — дефолтная политика retries: 3 попытки без экспоненциального backoff и без jitter. Медленный микросервис (например, обрабатывающий тяжелый запрос) не успевал ответить за 2 секунды. Traefik начинал retry storm, создавая новые TCP-соединения, которые бэкенд не мог обработать. Ядро быстро исчерпывало лимиты на соединения, и conntrack переполнялся. Диагностика: - ss -s — смотрим общее число сокетов и TIME_WAIT; - cat /proc/net/netfilter/nf_conntrack_count — проверяем заполнение conntrack; - sysctl net.netfilter.nf_conntrack_max — сравниваем с текущим использованием; - включите в Traefik maxRetries: 1 и exponentialBackOff + jitter. https://ftops.space/?utm_source=telegram&utm_...