Хотел почеленджить ребят на работе, что развернуть модельки просто. А именоо попробовав серверные истории SGLang, vLLM или Triton. А вот llama.cpp отказался, тк больше про локальный инференс, хотя на нем было бы через lm studio легко конечно)
Но везде оказались свои подводные камни. И как итог, Qwen3.8-9B-GGUF (Q4/Q5) вообще плохо поддерживается vLLM. Патч под Qwen 3.5 от некого чувака, который 24 часа делал его на Fable, тоже не помог. Плюс были проблемы с CUDA DLL и ZMQ.
При этом исходные оригинальные веса зачастую требуют слишком много памяти, а квантованные, которые собирают сторонние люди, уже поддерживаются заметно хуже.
Потом попробовал Gemma 4 E4B (safetensors и QAT), но vLLM и SGLang тоже не завелись из-за проблем с совместимостью compressed-tensors и мультимодальными особенностями.