Очередная «революция»: как запустить 300B модель на калькуляторе (спойлер: никак) 🤡

Спасибо за наводку на проект @mxvasilkin 🙂

Обожаю этот айтишний кликбейт от каналов, которые ведут неайтишники 🙂 «Революция! Гигантские нейросети теперь летают на домашнем ПК! DeepSeek 284B выдает 25 токенов/с на RTX 5090, а Qwen 35B летает на ноутбучной RTX 4060!»

Смотрим в конфиг и на название модели: Qwen3.6-35B-A3B. Что означают скромные буквы A3B? Они значат Active 3B.

Перед нами Mixture of Experts архитектура. Общий объем весов на диске — действительно 35 млрд параметров, но на каждый конкретный токен активируется всего 3 миллиарда.

По вычислительной нагрузке при генерации это эквивалент компактной трехмиллиардной сетки уровня Llama-3.2-3B. То, что модель с 3B активных параметров выдает ~40 токенов в секунду на чипе уровня 4060 — это как бы вообще не магия, так всегда и работает.

Давайте разбираться 🧐

Проект делают исследователи из Беркли, MIT и Стэнфорда (среди авторов — ребята, стоявшие за vLLM, SGLang и FlashInfer). Это не скам и не наколеночная поделка.

Как все устроено: 🔵 Все эксперты паркуются в оперативной памяти (Host RAM). 🔵 В VRAM создается динамический LRU-кэш под наиболее востребованные эксперты. 🔵 Если нужный эксперт есть в кэше — он считается на GPU. 🔵 Если cache miss — движок либо быстро тянет веса через PCIe, либо параллельно считает их на CPU, не забивая шину. 🔵 Плюс поддержка квантования весов в NVFP4, MXFP4 и FP8.

Но о чем неайтищные каналы не пишут:

🟠 Требования к системной RAM. Чтобы загрузить тот самый DeepSeek-V4 на 284B (даже умятый в 4 бита через NVFP4), нужно порядка 140–160 ГБ оперативной памяти. Назовите мне хоть один домашний ПК или ноутбук с RTX 4060, куда воткнуто 192 ГБ DDR5? Для этого нужна полноценная рабочая станция. 🟠 Красивые цифры — это строго Batch Size = 1. Скорость 39 токенов/с достигается только в идеальных условиях: один пользователь, короткий диалог и высокий процент попадания в кэш экспертов. Стоит пустить 2–4 параллельных запроса или резко сменить тему разговора — кэш экспертов развалится, и вы упретесь в пропускную способность шины PCIe и двухканальной DDR5 (где 60–80 ГБ/с — практический потолок). 🟠 Префилл (TTFT) будет страдать. Во время генерации читается 2–8 экспертов на шаг. Но при обработке входящего промпта (prefill на пару тысяч токенов) активируются практически все эксперты на всех слоях. На этом этапе даже топовый ПК будет заметно подвисать, интенсивно нагружая десятки гигабайт. 🟠 Ноутбучный PCIe. В мобильных RTX 4060 шина часто урезана до PCIe 4.0 x8 (а иногда и x4). Никаких рекордов на тяжелых запросах там не будет в принципе.

Чудес не бывает: запустить «300B модель на ноутбуке» без сотен гигабайт памяти вы по-прежнему не сможете. 🤷‍♂️

Очередная «революция»: как запустить 300B модель на калькуляторе (спойлер: никак) 🤡
Спасибо за наводку на проект @mxvasilkin 🙂
Обожаю этот айтишний кликбейт от каналов, которые ведут неайтишники 🙂
«Ре... | Сетка — социальная сеть от hh.ru