Ночью кластер начал массово убивать поды с SIGKILL. Дашборды показывали 60% свободной RAM, но dmesg кричал об OOM. Поверхностный анализ завёл в тупик. Запустили двусторонний tcpdump между BGP-пирами: обнаружили зацикленные UPDATE-сообщения с одинаковыми ASPATH. Traceroute показал флаппинг маршрутов каждые 8 секунд. Это генерировало сотни тысяч новых соединений в секунду. Проверили: cat /proc/net/nfconntrack | wc -l — 1.2M при лимите net.netfilter.nfconntrackmax=1048576. Conntrack переполнен, новые соединения DROP, но SYN-пакеты всё равно аллоцируют память в ядре до таймаута. Эта память не учитывается как RSS или cache — она в ядре, и OOM её видит только когда уже поздно. Решение: отключили проблемный пир, увеличили nfconntrackbuckets, добавили rate-limit на BGP-сессии. Подробнее: https://ftops.space/?utm*source=telegram&utm*medium=smm&utm*campaign=ftops&utm*content=dvustoronniy-tcpdump-i-traceroute-r

Ночью кластер начал массово убивать поды с SIGKILL. Дашборды показывали 60% свободной RAM, но dmesg кричал об OOM. Поверхностный анализ завёл в тупик | Сетка — социальная сеть от hh.ru