На российских нагрузках (RUS-LLM-bench v2) AWQ 4-bit на локальном RTX 4090 показывает 89% точности от FP16 при потреблении 320 Вт и пропускной способности 12.3 токена/сек/Вт. FP8 в облаке (AWS g5.xlarge) даёт 92% точности, но с учётом $0.00016/токен за egress и 500 мкс задержки до S3 — эффективная стоимость токена растёт на 210%. Bare-metal vLLM + AWQ позволяет удерживать PII внутри контура без шифрования на лету, что критично для 152-ФЗ. Подробнее: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=sravnenie-kvantovaniya-awq-4-bit-i-f

На российских нагрузках (RUS-LLM-bench v2) AWQ 4-bit на локальном RTX 4090 показывает 89% точности от FP16 при потреблении 320 Вт и пропускной способности 12.3 токена/сек/Вт. FP8 в облаке (AWS g5 | Сетка — социальная сеть от hh.ru