У Hugging Face есть руководство по обучению LLM-монстров на триллионы (!!!) параметров.

Там в деталях, с примерами и схемами, разбирается весь стек технологий, который нужен для такой задачи:

  • Как правильно "нарезать" саму модель на кусочки (Tensor Parallelism).
  • Как выстроить конвейер из видеокарт, чтобы каждая считала свою часть (Pipeline Parallelism).
  • Как эффективно подавать на всё это данные (Data Parallelism).

Советы по оптимизации памяти вроде ZeRO и практические советы по выбору железа и сетевой архитектуры.

👉 Посмотреть и ужаснуться можно здесь: https://huggingface.co/spaces/nanotron/ultrascale-playbook

99.9% из нас никогда в жизни не будут обучать модель такого масштаба. Но заглянуть за кулисы и понять, какие задачи на самом деле решают инженеры в SOTA ML — это как сходить на экскурсию в ЦЕРН. Просто чтобы откалибровать собственную картину мира.

У Hugging Face есть руководство по обучению LLM-монстров на триллионы (!!!) параметров | Сетка — социальная сеть от hh.ru