На практике AWQ 4-bit с сохранением аутлайер-каналов показывает стабильную p99-латентность 117 мс на Llama-3-8B-Instruct на одном RTX 4090. Потребление — 0.8 Вт на токен. FP8 на облачных A100 требует NVLink, CUDA Graphs и всё равно выдаёт 210 мс p99 при 3.4 Вт/токен — плюс скрытая стоимость: egress $0.12/GB, арендная плата за GPU в $3.2/час и нулевой контроль над PII. В суверенном контуре AWQ позволяет разместить 4×8B модели на одном узле с полной изоляцией через WireGuard /32 и локальной санитизацией промптов. FP8 же привязывает к архитектуре NVIDIA H100/A100 и облаку — где каждый токен платит дважды: за вычисления и за право уйти. Подробный бенчмарк и TCO-калькулятор: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=sravnenie-kvantovaniya-awq-4-bit-i-f