Сравнение квантования AWQ 4-bit и FP8 на российских инфраструктурных нагрузках — это проверка на инженерную зрелость, а не слепое следование маркетингу вендоров. Облачные провайдеры навязывают FP8 под предлогом нативной поддержки в новых ускорителях, но забывают про утилизацию полосы пропускания памяти и реальный TCO на bare-metal. В условиях локального контура и жестких требований 152-ФЗ каждый гигабайт VRAM на вес золота. AWQ 4-bit сжимает модель вдвое сильнее, высвобождая драгоценное пространство под context window и PagedAttention vLLM, в то время как FP8 часто упирается в ограничения локального железа без прироста качества, который реально окупает затраты на покупку или аренду оборудования. Хватит кормить облачный картель и переплачивать за избыточную разрядность там, где решает плотность токенов на ватт. Переходите на суверенный инференс без посредников: https://run-as-daemon.dev