AI-агенты в длинных сессиях теряют фокус не из-за ограничений модели, а из-за хаотичного управления KV-кэшем. В облаке гиперскейлеры не предоставляют контроля над eviction policy — кэш фрагментируется, attention weights деградируют, а TCO взлетает из-за egress-платежей за пересылку состояния между нодами. На нашей суверенной инфраструктуре (bare-metal + vLLM + PagedAttention) мы добились p99 latency <150 мс при 128K контексте и деградацией attention <4% после 6 часов непрерывной сессии. Расход энергии — 0.8 Вт/токен против 3.2 Вт/токен в AWS g5.48xlarge с аналогичной моделью. Контекстное окно — это не feature, а состояние, которое должно оставаться внутри юрисдикции. Подробнее: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=upravlenie-kontekstnym-oknom-v-dlin

AI-агенты в длинных сессиях теряют фокус не из-за ограничений модели, а из-за хаотичного управления KV-кэшем | Сетка — социальная сеть от hh.ru