NVIDIA Blackwell демонстрирует рекордную производительность в MLPerf
Ускорители NVIDIA Blackwell показали более чем 2,2-кратное превосходство над H100 в тестах MLPerf Training 4.1, проведённых на суперкомпьютере NVIDIA Nyx. Blackwell обеспечили прирост производительности в задачах обучения крупных языковых моделей (LLM), рекомендательных систем и генерации изображений, благодаря улучшенной пропускной способности памяти HBM3e и повышенной вычислительной мощности.
Новый ускоритель продемонстрировал в 2,27 раза более высокую производительность в вычислениях FP8, FP16, BF16 и TF32, что позволило сократить количество чипов до 64 для успешного обучения GPT-3, тогда как H100 потребовалось бы 256. В то же время NVIDIA продолжает оптимизировать поколение Hopper, которое остаётся конкурентоспособным.
Google представила TPU 6-го поколения Trillium, который обеспечивает 3,8-кратный прирост производительности по сравнению с TPU v5e. Однако в задаче обучения GPT-3 система из 6144 TPU v5p уступила NVIDIA H100, завершив задачу за 11,77 минут против 3,44 минут. В тестах меньшего масштаба TPU также отстают на 50 % от решений NVIDIA, хотя Google акцентирует внимание на масштабируемости и выгодной стоимости.
Единственный тест энергопотребления показал, что система NVIDIA с H100 потребила 16,38 мДж за 5,05 минут, с мощностью 54,07 кВт, демонстрируя сбалансированное сочетание эффективности и производительности.