В 03:17 по UTC кластер начал терять трафик. Дашборды показывали рост latency в upstream-сервисе, но его CPU и память были в норме. Глубокий разбор показал: Traefik по умолчанию делает до 3 retries с минимальной задержкой 50ms (https://doc.traefik.io/traefik/routing/services/#retry-configuration). При p95 ответа 200ms это создало лавину повторных запросов — 4x исходной нагрузки. Команды диагностики: - journalctl -u traefik | grep -i retry — подтверждает частоту попыток. - ss -i state established | grep : — показывает всплеск TIME_WAIT после шторма. - netstat -s | grep retrans — рост TCP retransmits из-за перегрузки бэкенда. Ядро не врёт: conntrack заполнился, OOM-killer начал чистку, а Traefik продолжал слать новые попытки. Полный разбор на https://ftops.space/?utm_source=telegram&utm_medium=smm&utm_campaign=ftops&utm_content=traefik-ingress-retry-storms-kak-de

В 03:17 по UTC кластер начал терять трафик. Дашборды показывали рост latency в upstream-сервисе, но его CPU и память были в норме | Сетка — социальная сеть от hh.ru