27 мая, 02:48 МСК — пиковая нагрузка на LLM-сервис для госреестра. Облачный инстанс с FP8 (Azure ND H100 v5) начал терять токены при 18 запросах/сек: задержка p99 выросла с 420 мс до 2.1 с за 8 минут. Причина — тепловое троттлинг и shared memory contention в гипервизоре. Локальный bare-metal узел с AWQ 4-bit (RTX 4090, 112 Вт, kernel 6.8 + vLLM 0.4.3) выдал 38 токенов/сек при стабильных 98 мс p99. Энергоэффективность: 0.34 токена/Вт против 0.11 у FP8 в облаке. Стоимость токена: 0.00017 ₽ локально vs 0.0014 ₽ в Azure (включая egress и compliance markup). При этом только локальный контур соответствует 152-ФЗ: данные не покидают ДЦ ФСТЭК. Подробный постмортем и метрики — https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=sravnenie-kvantovaniya-awq-4-bit-i-f

27 мая, 02:48 МСК — пиковая нагрузка на LLM-сервис для госреестра. Облачный инстанс с FP8 (Azure ND H100 v5) начал терять токены при 18 запросах/сек: задержка p99 выросла с 420 мс до 2.1 с за 8 минут | Сетка — социальная сеть от hh.ru