После миграции stateful-сервиса из bare-metal K3s в AWS EKS команда наблюдала рост p99 latency с 0.3 мс до 14 мс. CloudWatch показывал «здоровую» сеть, но ss -i на нодах выявлял постоянные retransmit и увеличение cwnd. Причина — TCP Small Queues (TSQ) в ядре Linux, активированные по умолчанию в AMI. TSQ ограничивает буфер отправки на соединение, вызывая искусственное дросселирование даже при свободной пропускной способности. На bare-metal с ядром 6.6+, где net.core.default_qdisc = fq_codel и net.ipv4.tcp_notsent_lowat = 16384, latency стабильно ниже 100 мкс. В облаке же — виртуализированный NIC, shared CPU и TSQ создают скрытый backpressure. Проверить можно через: cat /proc/net/softnet_stat, tc -s qdisc show dev eth0, и nstat -az | grep TcpRetransSegs. Юнит-экономика гиперскейлеров игнорирует стоимость задержки: 490K/мес за инстансы — и вы всё равно ждёте ACK от соседа по хосту. Подробнее: https://ftops.space/?utm_source=telegram&utm_medium=smm&utm_campaign=ftops&utm_content=bare-metal...

После миграции stateful-сервиса из bare-metal K3s в AWS EKS команда наблюдала рост p99 latency с 0.3 мс до 14 мс | Сетка — социальная сеть от hh.ru