Сравнение квантования AWQ 4-bit и FP8 на российских инфраструктурных нагрузках в очередной раз доказывает: облачные шаблоны не работают на собственном железе. Когда каждый терафлопс на счету, а доступ к современным ускорителям ограничен санкционным периметром, погоня за FP8 превращается в дорогое баловство для любителей арендованных GPU. На реальных bare-metal нодах узким горлышком становится пропускная способность памяти и шина. AWQ 4-bit позволяет разместить модель компактнее, снизить требования к числу карт в стойке и обеспечить предсказуемый throughput без просадок на десериализации. В то время как FP8 требует новейшего оборудования, которое вам любезно предлагают арендовать втридорога американские гиганты, убивая вашу маржу. Стройте суверенный контур на проверенном железе, управляйте кривой предельной стоимости токена и забудьте про облачный налог. Детали архитектуры и готовые конфигурации для развертывания на своих серверах собраны на https://run-as-daemon.dev