🚀 Как обучать LLM децентрализованно на GPU AMD
AMD представила пошаговое руководство по децентрализованной дообучке LLM на Instinct MI300.
Алгоритм DiLoCo позволяет обучать модели на слабосвязанных кластерах, уменьшая частоту коммуникаций. Вместо постоянного обмена градиентами, кластеры работают автономно (внутренние шаги), синхронизируясь только раз в несколько сотен итераций (внешние шаги). Это снижает зависимость от высокоскоростных сетей. В реализации Prime применяется FSDP внутри узлов, сжатие градиентов до INT8 и elastic device mesh с проверкой работоспособности.
На MI300 ускорители DiLoCo показал лучшую сходимость, чем классический FSDP, а сжатие градиентов почти не повлияло на качество.