Сравнение AWQ 4-bit и FP8 на российских bare-metal нагрузках — это не бенчмарк, а проверка на суверенитет. На RTX 4090 (доступной без лицензий) AWQ 4-bit обеспечивает 38 токенов/сек при 112 Вт и нулевых egress-издержках. FP8 в облаке требует H100, NVLink, привязки к CUDA Graphs и стоит от $4.5/час — при этом latency выше из-за shared-планировщика. Экономика проста: при 8760 часов/год bare-metal GPU окупается за 5 месяцев. Облачный FP8 — никогда. К тому же, каждый токен через Azure или AWS — риск нарушения 152-ФЗ из-за принудительного доступа по CLOUD Act. Подробный разбор метрик, TCO и рекомендации по развёртыванию — на https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=sravnenie-kvantovaniya-awq-4-bit-i-f

Сравнение AWQ 4-bit и FP8 на российских bare-metal нагрузках — это не бенчмарк, а проверка на суверенитет | Сетка — социальная сеть от hh.ru