Разбор архитектурных реалий инференса на российских bare-metal мощностях показывает принципиальную разницу между AWQ 4-bit и FP8 в продакшене. Когда заводы и корпорации разворачивают локальные контуры под требования 152-ФЗ, выбор формата весов определяет не просто точность перплексии, а выживание инфраструктурного бюджета. Формат FP8 требует нативной поддержки тензорных ядер новейших поколений, которые в текущих реалиях обходятся в астрономические суммы при аренде и закупке. AWQ 4-bit при грамотной калибровке на локальных датасетах сохраняет точность генерации на уровне исходных весов, но укладывается в более узкую полосу пропускания памяти, снижая требования к шине и позволяя упаковывать больше контекста на один узел без потери latency. Облачный картель навязывает тяжелые окружения и дорогие GPU ради собственной маржи. Мы в @run-as-daemon.dev строим суверенные контуры на чистом vLLM с жестким контролем токен-плотности и изоляцией данных. Изучите архитектуру суверенных шлюзов на https://run-as-daemon.dev

Разбор архитектурных реалий инференса на российских bare-metal мощностях показывает принципиальную разницу между AWQ 4-bit и FP8 в продакшене | Сетка — социальная сеть от hh.ru