На практике российские инфраструктурные контуры сегодня строятся на NVIDIA A100 и AMD MI210 — железе, доступном до 2022 года. FP8-квантование, активно продвигаемое NVIDIA, требует архитектуры Hopper (H100) и драйверов CUDA 12.3+, которых нет в суверенных ЦОДах по объективным причинам. AWQ 4-bit, напротив, работает на Volta/Ampere без модификации ядра. На модели Llama-3-8B при batch=8 и seqlen=16K AWQ потребляет 18.2 ГБ VRAM против 28.9 ГБ у FP16 и 22.7 ГБ у FP8 (если бы он работал). Потери в perplexity — 1.7–2.1% относительно FP16, что приемлемо для внутренних RAG и агентов. Экономика проста: 1 токен инференса на арендованном облаке стоит $0.00012. На bare-metal с AWQ — $0.000031. Разница в 3.9× накапливается в миллионы за квартал. Подробнее — *https://run-as-daemon.dev/?utm*source=telegram&utm*medium=smm&utm*campaign=rad*ru&utm*content=sravnenie-kvantovaniya-awq-4-bit-i-f

На практике российские инфраструктурные контуры сегодня строятся на NVIDIA A100 и AMD MI210 — железе, доступном до 2022 года | Сетка — социальная сеть от hh.ru