Тесты на vLLM 0.5.4 + RTX 4090 (локально) против Azure ND A100 v4 показывают: AWQ 4-bit обеспечивает 327 токенов/сек при 210 Вт, FP8 в облаке — 298 токенов/сек при 340 Вт с учётом гипервизора и egress-налога. Разница в предельной стоимости токена — 2.3× в пользу bare-metal. FP8 требует строгой калибровки под распределение входных данных. В условиях российской локализации (кириллица, специфичные домены, PII в промптах) его динамический диапазон нестабилен без предварительной санитизации — а в облаке вы её не контролируете. AWQ 4-bit сохраняет точность даже при энтропийном дрейфе токенизатора, если квантование выполнено на репрезентативном корпусе. Это делает его единственным viable-вариантом для суверенного инференса в закрытом контуре. Детали архитектуры, метрики плотности токенов на ватт и методика локального квантования — в нашем гайде: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=sravnenie-kvantovaniya-awq-4-bit-i-f