Выбор между AWQ 4-bit и FP8 на российских инфраструктурных нагрузках часто упирается в слепую веру в таблички производителей железа, а не в суровую физику шины памяти. В условиях санкционного дефицита ускорителей инференс на старых или промежуточных PCIe-конфигурациях упирается в пропускную способность памяти. FP8 навязывается вендорами как стандарт, но на практике он сжигает полосу пропускания шины ради эфемерной точности, которую продают дороже. В то же время AWQ 4-bit позволяет плотно упаковать веса моделей без деградации бизнес-метрик на специфических промптах, выдавая реальную утилизацию кэша и предсказуемый RPS на голом железе. Облачный картель навязывает FP8, чтобы вы быстрее уперлись в аппаратные лимиты и побежали покупать новые инстансы. Суверенный инференс через @runasdaemon.dev на bare-metal vLLM забирает контроль над кривой предельной стоимости токена обратно под ваш замок: https://run-as-daemon.dev

Выбор между AWQ 4-bit и FP8 на российских инфраструктурных нагрузках часто упирается в слепую веру в таблички производителей железа, а не в суровую физику шины памяти | Сетка — социальная сеть от hh.ru