На российских bare-metal стеках (AMD EPYC + RTX 6000 Ada) AWQ 4-bit демонстрирует 187 токенов/сек на LLaMA-3-8B при 256 контексте, тогда как облачный FP8 (AWS g6e.xlarge) выдает лишь 58 токенов/сек с задержкой 310 мкс из-за NVLink эмуляции и PCIe-ограничений. Энергопотребление AWQ — 210 Вт против 340 Вт у FP8. Стоимость токена: $0.000012 на локальном AWQ против $0.000039 в облаке — разница в 3.25×, даже без учета egress-налога ($0.09/GB). При ежедневной нагрузке 10M токенов экономия — $270/день или $98K/год. FP8 требует специфичного железа (H100), которого нет в РФ. AWQ работает на любом Turing+/Ampere+, включая отечественные сборки. Это не компромисс — это выбор между контролем и зависимостью. Подробный бенчмарк и методика воспроизведения: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=sravnenie-kvantovaniya-awq-4-bit-i-f