Как запустить LLM на 2,8 трлн параметров на ноутбуке

Всем привет 👋 😊

Модель на 2,8 трлн параметров запустили на одном ноутбуке. Скорость — минута на токен.

Звучит как курьёз. Но внутри — обычная инженерная задача: иерархия памяти, последовательное чтение, префетч. Знакомо любому бэкендеру.

Разбираем #MixtureOfExperts, оффлоад весов и почему генерация упирается в память, а не в вычисления. Понимать это полезно всем, кто смотрит в сторону #LocalLLM и #MachineLearning.

Ссылка на статью: https://habr.com/ru/companies/otus/articles/1067738/

Буду рад обсудить в комментариях 🤝