Next-generation LLM Inference Network: How ZCube Alleviates Network Bottlenecks?

Коллега подкинул свежую статью про сети для LLM.

Китайские инженеры из Z.ai, Harnets.AI и университета Цинхуа разработали новую архитектуру ZCube, в которой заменили классический Clos на плоскую топологию и получили:

Экономия: Минус 33% на коммутаторах и оптике.

Скорость: +15% пропускной способности инференса.

Задержка: TTFT (Time to First Token) снизился на 40.6% (P99).

В чем магия (коротко)

Раньше в ROFT (Rail-Optimized Fat-Tree) трафик KV Cache шел асимметрично, перегружая одни и те же Leaf-коммутаторы. Возникали локальные «заторы» и PFC-паузы. ZCube просто убирает уровень Spine-коммутаторов и использует гибрид single-rail / multi-rail подключения. Диаметр сети - 2 хопа, а балансировка нагрузки практически идеальная.

В проде работает уже больше двух недель.

Подробней с красивыми схемами - по ссылке выше.

🎤 Буднисетевика 😊


В этом посте были ссылки, но мы их удалили по правилам Сетки

Next-generation LLM Inference Network: How ZCube Alleviates Network Bottlenecks?
Коллега подкинул свежую статью про сети для LLM.
Китайские инженеры из Z.ai, Harnets | Сетка — социальная сеть от hh.ru