Как запустить LLM на 2,8 трлн параметров на ноутбуке
Всем привет 👋 😊
Модель на 2,8 трлн параметров запустили на одном ноутбуке. Скорость — минута на токен.
Звучит как курьёз. Но внутри — обычная инженерная задача: иерархия памяти, последовательное чтение, префетч. Знакомо любому бэкендеру.
Разбираем #MixtureOfExperts, оффлоад весов и почему генерация упирается в память, а не в вычисления. Понимать это полезно всем, кто смотрит в сторону #LocalLLM и #MachineLearning.
Ссылка на статью: https://habr.com/ru/companies/otus/articles/1067738/
Буду рад обсудить в комментариях 🤝