План B! Запуск модели ornith:35b на ПК и новая память!
Привет всем! А вы уже видели Benchmark новой модели qwen3.8 27B? Вообще это было ожидаемо, что будут появляется довольно неплохие иишечки для локальной работы на своём ПК. Думаю такой напарник должен быть у каждого на своей локальной машине! Раньше я запускал этот движ на своём ноуте (MSI katana 16ram 3050 rtx на 4 гига) ну понятно что модель с 9м/параметров и весом 8-10 гиг будет работать с частичной выгрузкой на ЦПУ задействовав махимум 18 слоёв от 4 гиговой видеокарты. Все это работает, но очень медленно) модели поменьше это простое баловство,если ты делаешь серьёзный проект, а про контекстное окно вообще нет смысла что то говорить. Моя боль была в том и я понимал ещё около года назад, что нужно срочно покупать хорошую сборку настольного ПК, но не мог это себе тогда позволить. Чтобы приобрести сборку, пришлось не мало потрудится. Конечно сборку получилось взять не самую крутую, но уже можно было запускать например Owen 3.7 35 m/параметров весом на 18 -19 гигов с 4-ым квантованием. Скорость не плохая и по программированию он висма не плох, но опять же все упирается в контекст который и так сам по себе деградирует превысив 60000 тысячное окно! Опять боль) но упертость и интуиция меня все равно убеждали в том что это можно решить! вопрос в том, как? Я напомню ,что первый мой пост в сетке как раз про то как я решил вопрос с контекстом, да это спорный вопрос на длинных проходах, но я уже знаю как это решить. Про это я думаю сделать отдельный пост.
Теперь к самой сути! Как оказалось я не один такой, кто пытается решить эту боль. Вот нет у меня сейчас денег например платить провайдеру за вызов мощной модели, а проект который в сети, требует внимания . Тут то и нужен План B. Нашел человека который рассказывает то как он запускает Owen 3.6 35 m/параметров весом на 18 -19 гигов с 4-ым квантованием на видеокарте gtx 1060 с 6 гигами 16 оперативки с полным контекстом в 256000 и скоростью 17ток/c , более детально :
Это не просто «запуск модели», это инженерный обход физических ограничений VRAM через агрессивную математику и распределение вычислений. Я использую три мощных рычага одновременно, и именно это позволяет модели весом ~20 ГБ (Q4_K_M) жить на 6 ГБ видеопамяти: turbo4 / turbo3 — это ключ. Я не просто квантую веса, я сжимаю KV-cache (память контекста) до 4/3 бит. Это убивает самую большую проблему локальных LLM — жор VRAM на длинных диалогах. –n-cpu-moe 36 — гениально для Qwen 3.6 35B-A3B. Модель MoE (35B параметров, но активно только ~3B). Выгружаю все неактивные экспертные слои на CPU, освобождая место под активные вычисления в GPU. –mlock --no-mmap --ulimit memlock=-1 — фиксирует данные в оперативной памяти, запрещая ОС свапить их на диск. Это предотвращает микрофризы и «тормоза» при переключениях. Такой вариант с turboQuant (256K контекста на 6 ГБ) — это фактически «хакинг» железа. Обычный llama.cpp просто физически не потянет 128K контекста на этой карте, а мой форк — да.
for turbo quant you need to build it from source and then mount it on a cuda container docker run --rm --gpus all \ –ulimit memlock=-1 \ –cap-add=IPC_LOCK \ -v /root:/root \ -w /root/llama-cpp-turboquant \ -p 8080:8080 \ nvidia/cuda:12.4.1-devel-ubuntu22.04 \ ./build/bin/llama-server \ -m /root/models/Qwen_Qwen3.6-35B-A3B-Q4_K_M.gguf \ –port 8080 --host 0.0.0.0 \ –cache-type-k turbo4 --cache-type-v turbo3 \ –n-cpu-moe 36 \ -ngl 99 \ –no-mmap --mlock \ –jinja \ -c 256000 эти флаги для тех кто в теме и сможет понять без лишних слов) Если кото то не знает как это сделать, я буду только рад новым знакомствам!) В конце поста хотел добавить ,то что всё-таки я испытал данный движ и это в натуре работает, но большей радостью для меня оказалось то, что этот колдун сделал память для модели такую что имеет общую цель с моим проектом (Contextor) суть очень близка по смыслу возвращать твоему агенту правильную память, хорошо организованную структуру при помощи доп. модели ии библиотекаря! Изучая его проект я понял что смогу доработать Contextor и сделать его весьма крутым движком!