05 On-prem инференс: развертывание vLLM / Ollama на собственном железе
vLLM на RTX 3050 (4 GB GDDR6): 45.2 токенов/сек, модели qwen2.5-coder:1.5b, dentist-vlm:v1.1, qwen2.5vl:3b Ollama на AMD Radeon RX 550 (4 GB GDDR5, Vulkan) + 31 GB RAM: пакетный анализ, dentist-vlm:v1.1 Замена OpenAI API без потери качества при локальном развертывании.
run-as-daemon.dev