Инцидент: задержки у AI inference-воркеров превысили SLA в 3 раза. Мониторинг указывал на высокую загрузку GPU и «медленные ответы от backend». На самом деле, CNI (Flannel/VXLAN) добавлял два контекстных переключения, обход через conntrack и копирование пакетов через veth. Диагностика: - ss -i показал увеличенный rtt у TCP-сессий внутри подов. - perf record -e 'net:' выявил горячие точки в dev_queue_xmit и nf_hook_slow. - cat /proc/net/dev — рост RX dropped на cni0. Решение: переход на hostNetwork + SO_REUSEPORT на сокетах. Latency упал с 120 мкс до 22 мкс. Подробный разбор: https://ftops.space/?utm_source=telegram&utm_medium=smm&utm_campaign=ftops&utm_content=host-networking-vs-cni-bridges-dlya

Инцидент: задержки у AI inference-воркеров превысили SLA в 3 раза. Мониторинг указывал на высокую загрузку GPU и «медленные ответы от backend» | Сетка — социальная сеть от hh.ru