В Твиттере появился довольно неплохой гайд по запуску локальных LLM — один знаток подробно описал все нюансы использования llama.cpp

Там есть все: текстовые рекомендации, полезные флаги для оптимизации: --fit on, --fit-ctx 65536, --fit-target 512 и другие полезности.

Магии не ждите, но выжать больше токенов в секунду из своего железа можно 😋

В Твиттере появился довольно неплохой гайд по запуску локальных LLM — один знаток подробно описал все нюансы использования llama | Сетка — социальная сеть от hh.ru