Moore Threads разрушает монополию NVLink
В июле 2026 года Moore Threads официально подтвердила, что её фабрика межчипового соединения MTLink теперь поддерживает масштабирование до 10 000 GPU в едином AI-кластере. Достигнут технический рубеж, который до сих пор был исключительной вотчиной Nvidia и её проприетарной технологии NVLink. Для российских enterprise заказчиков, которым годы санкций закрыли доступ к H100 и B200, посылает очередной сигнал: китайский GPU стек впервые стал реальной альтернативой не на уровне одной карты, а на уровне кластерной архитектуры целиком.
Что такое MTLink и почему это важно
NVLink - это разработка Nvidia, которая позволяет GPU общаться друг с другом напрямую, минуя узкое место шины PCIe. Без высокоскоростной фабрики связи построить кластер для тренировки LLM на тысячах карт физически невозможно - узкое место в сети задушит полезную производительность. MTLink - это ответ Moore Threads на NVLink. Технология позволяет объединять GPU в единую высокопроизводительную фабрику с минимальными задержками. До последнего времени Moore Threads демонстрировала стабильную работу кластеров на несколько сотен карт (проект Куаэ / KUAE). Переход к 10 000 GPU выглядит как качественный скачок, выводящий китайское решение в тяжёлый вес.
· Линейный коэффициент масштабирования: в тестах Moore Threads на уровне 90 - 95% при масштабировании до тысяч карт. Для сравнения: Nvidia считается эталоном с показателем ~98%, но разрыв непрерывно сокращается. · Эффективная доля времени тренировки (MFU): >40% для плотных моделей, >60% для MoE архитектур на кластерах S5000. · Стабильность: коэффициент аптайма кластера превышает 90% в многодневных тренировочных прогонах.
Два IPO, которые изменили рынок
История Moore Threads и MetaX за последние 12 месяцев выглядит как сценарий к фильму. В декабре 2025 года обе компании вышли на IPO в Шанхае (биржа STAR Market) - и акции взлетели: Moore Threads: Дата IPO: дек 2025; Рост в первый день: +400%; Оценка post-IPO: ~$28 млрд; MetaX: Дата IPO: дек 2025; Рост в первый день: +693%; Оценка post-IPO: ~$42 млрд; MetaX, основанная бывшими инженерами AMD, привлекла $596 млн при том, что сама компания пока убыточна (чистый убыток 830 млн юаней при выручке 1,6 млрд). Инвесторы покупают не прибыль, а государственную стратегию Китая: к 2029 году рынок AI-чипов в КНР должен достичь $189 млрд (против $54 млрд в 2026-м).
На уровне маркетинговых презентаций разница между китайским и американским GPU-стеком выглядит как вопрос цены. На инженерном уровне это фундаментальный конфликт двух парадигм: гонка за пиковой плотностью транзисторов (TSMC 4N) против оптимизации архитектуры под зрелые техпроцессы (SMIC 7nm). HBM3e vs GDDR6X в контексте LLM
Nvidia H200: Использует память HBM3e с пропускной способностью (Bandwidth) около 4,8 ТБ/с на ускоритель. Это позволяет удерживать огромные матрицы весов (до 141 ГБ у флагманских версий) непосредственно рядом с вычислительными блоками. Узким местом здесь выступает не объем, а задержки контроллера при случайном доступе к KV-кэшу в MoE-моделях.
Moore Threads S5000: Оснащается 80 ГБ видеопамяти. В зависимости от ревизии используется либо стек HBM2e (~820 ГБ/с), либо массивная подсистема из чипов GDDR6/GDDR6X.
· Инженерный компромисс: Пропускная способность S5000 значительно ниже (ориентировочно 500 - 700 ГБ/с). Чтобы компенсировать этот разрыв, архитекторы Moore Threads увеличили объемы локальных SRAM-кешей внутри MUSA ядер. · Последствие для заказчика: При тренировке плотных моделей семейства Llama-3 (70B/405B) кластер на S5000 вынужден чаще обращаться к основной системной памяти или делать агрессивный своп через MTLink, что вызывает микро остановки конвейера (pipeline stalls). Однако для инференса, где критичен объем одной карты, 80 ГБ S5000 позволяют целиком разместить модель Qwen-72B без квантования до INT4.
Межчиповая фабрика: NVLink 4 / InfiniBand против MTLink v2
Скорость обучения зависит не от терафлопс одного чипа, а от того, насколько быстро градиенты синхронизируются между тысячами карт.