У Hugging Face есть руководство по обучению LLM-монстров на триллионы (!!!) параметров.
Там в деталях, с примерами и схемами, разбирается весь стек технологий, который нужен для такой задачи:
- Как правильно "нарезать" саму модель на кусочки (Tensor Parallelism).
- Как выстроить конвейер из видеокарт, чтобы каждая считала свою часть (Pipeline Parallelism).
- Как эффективно подавать на всё это данные (Data Parallelism).
Советы по оптимизации памяти вроде ZeRO и практические советы по выбору железа и сетевой архитектуры.
👉 Посмотреть и ужаснуться можно здесь: https://huggingface.co/spaces/nanotron/ultrascale-playbook
99.9% из нас никогда в жизни не будут обучать модель такого масштаба. Но заглянуть за кулисы и понять, какие задачи на самом деле решают инженеры в SOTA ML — это как сходить на экскурсию в ЦЕРН. Просто чтобы откалибровать собственную картину мира.