Next-generation LLM Inference Network: How ZCube Alleviates Network Bottlenecks?
Коллега подкинул свежую статью про сети для LLM.
Китайские инженеры из Z.ai, Harnets.AI и университета Цинхуа разработали новую архитектуру ZCube, в которой заменили классический Clos на плоскую топологию и получили:
• Экономия: Минус 33% на коммутаторах и оптике.
• Скорость: +15% пропускной способности инференса.
• Задержка: TTFT (Time to First Token) снизился на 40.6% (P99).
▎В чем магия (коротко)
Раньше в ROFT (Rail-Optimized Fat-Tree) трафик KV Cache шел асимметрично, перегружая одни и те же Leaf-коммутаторы. Возникали локальные «заторы» и PFC-паузы. ZCube просто убирает уровень Spine-коммутаторов и использует гибрид single-rail / multi-rail подключения. Диаметр сети - 2 хопа, а балансировка нагрузки практически идеальная.
В проде работает уже больше двух недель.
Подробней с красивыми схемами - по ссылке выше.
🎤 Буднисетевика 😊
В этом посте были ссылки, но мы их удалили по правилам Сетки