Управление контекстным окном в агентских сессиях — не про "больше токенов", а про стабильность attention weights под нагрузкой. В облаке KV-кэш живёт в shared memory пулах, где LRU eviction работает вслепую: старые, но критичные ключи вытесняются ради свежих, но шумовых токенов. На bare-metal с vLLM и фиксированным GPU NUMA-доменом мы внедряем time-aware sparse eviction: приоритет по clock-skew + semantic weight (из RAG-метаданных). Результат — деградация внимания <7% даже после 10 циклов 64K-контекста. Стоимость: AWS g5.48xlarge ($32/hr) даёт 1.8 токена/ватт при 128K. Наш Ryzen Threadripper 7985WX + 4×RTX 4090 — 4.3 токена/ватт при том же окне, TCO на 3 года ниже в 5.2 раза. Egress-fee за пересылку контекста в SaaS-RAG? Это прямой субсидиарный платеж картелю. Детали архитектуры, метрики latency-per-token и скрипты для локального KV-sparsification — на https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=upravlenie-kontekstnym-oknom-v-dlin