Длинные контексты (>32K) в managed-сервисах страдают от деградации внимания не из-за слабости архитектуры, а из-за принудительной распределённости: веса, KV-кэш и запрос разнесены по разным NUMA-нодам или даже зонам доступности. Задержка межнодового обмена (≥150 мкс) убивает эффективность softmax-внимания. На bare-metal с x16 PCIe bifurcation и привязкой vLLM-воркеров к CPU core + NVMe namespace мы удерживаем полный KV-кэш в L3+DRAM одного сокета. Плотность токенов на ватт растёт на 37% против AWS p4d.24xlarge при том же QPS. Стоимость хранения 1 млн токенов контекста в облаке — $0.012/час только за egress и memory bandwidth tax. Локально — $0.0018. Разница покрывает амортизацию NVMe на 3 года. https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=upravlenie-kontekstnym-oknom-v-dlin