Сравнение квантования AWQ 4-bit и FP8 на российских инфраструктурных нагрузках вскрывает простую физику железа. Облачные вендоры и любители арендовать чужие GPU молятся на FP8, забывая, что на стандартных PCIe-шинах локальных серверов узким горлышком становится пропускная способность памяти, а не терафлопсы. В реальном bare-metal контуре AWQ 4-bit уплотняет модель до состояния, когда KV-cache перестает раздувать VRAM до аварийного сброса. Вы получаете стабильный RPS без переплаты за избыточный парк ускорителей, соблюдая требования 152-ФЗ по изоляции данных внутри периметра организации. Хватит субсидировать чужие дата-центры почасовой арендой. Переносите критичные пайплайны на собственное железо с vLLM и защищенным WireGuard mesh. Архитектурные детали и суверенные шлюзы опубликованы на https://run-as-daemon.dev.