Запустила LLM Qwen3.8-Flash-Next на потребительской GPU 16GB

* OS: Melawy Linux (Arch-based), Linux Kernel XanMod (Native compile) 7.2.1. * Hardware: PCIe 4: CPU AMD Ryzen 7 5700X, MB ASUS B550, RAM 128GB 3600 MHz, GPU AMD RX 9070 XT 16 GB, SATA III SSD 6 Gb/s (up to 550 MB/s in real use). * LLM Server: llama.cpp rocm hip git (Native compile). * Model: Qwen3.8-Flash-Next-Uncensored-i1-Q4_K_S.gguf * Context: 262144 * KV Cache: F16

```ini ExecStart=/usr/bin/llama-server \ -m Qwen3.8-Flash-Next-Uncensored-i1-Q4_K_S.gguf \ --mmproj Qwen3.8-Flash-Next-Uncensored.mmproj-f16.gguf \ --image-min-tokens 1024 \ --jinja \ --no-skip-chat-parsing \ --reasoning on \ --reasoning-preserve \ --reasoning-format auto \ -cmoe \ -fit off \ --n-gpu-layers 99 \ --threads 8 \ --threads-batch 16 \ --batch-size 2048 \ --ubatch-size 512 \ --parallel 16 \ --ctx-size 262144 \ --context-shift \ --cont-batching \ --kv-unified \ --cache-prompt \ --cache-ram 8192 \ --cache-idle-slots \ --cache-type-k f16 \ --cache-type-v f16 \ --flash-attn on \ --temp 1.0 \ --top-k 20 \ --top-p 0.95 \ --min-p 0.00 \ --repeat-last-n 512 \ --repeat-penalty 1.00 \ --presence-penalty 0.00 \ --host 0.0.0.0 \ --port 11441 \ --reuse-port ```


21.6% (56623 of 262144) Ctx. VRAM USAGE 15.777 of 15.922 Gi Available. RAM USAGE 6.74 of 128 Gi. 15 -> 13.0 t/s speed. 0 -> 21.6% Ctx.


50.7% (132907 of 262144) Ctx. VRAM USAGE 15.781 of 15.922 Gi Available. RAM USAGE 7.75 of 128 Gi. 15 -> 12.12 t/s speed. 0 -> 50.7% Ctx.

Запустила LLM Qwen3.8-Flash-Next на потребительской GPU 16GB | Сетка — социальная сеть от hh.ru Запустила LLM Qwen3.8-Flash-Next на потребительской GPU 16GB | Сетка — социальная сеть от hh.ru
Запустила LLM Qwen3.8-Flash-Next на потребительской GPU 16GB | Сетка — социальная сеть от hh.ru Запустила LLM Qwen3.8-Flash-Next на потребительской GPU 16GB | Сетка — социальная сеть от hh.ru Запустила LLM Qwen3.8-Flash-Next на потребительской GPU 16GB | Сетка — социальная сеть от hh.ru Запустила LLM Qwen3.8-Flash-Next на потребительской GPU 16GB | Сетка — социальная сеть от hh.ru Запустила LLM Qwen3.8-Flash-Next на потребительской GPU 16GB | Сетка — социальная сеть от hh.ru