Длинные контексты в публичном облаке — это ловушка предельной стоимости. При 128K токенах KV-кэш LLaMA-3-8B занимает ~20 ГБ VRAM. На A100 это 1 запрос на GPU. В bare-metal vLLM с PagedAttention можно уместить 8 таких сессий — при том же железе. Облачный провайдер берёт $2.50 за 1M output токенов, но скрывает, что 70% стоимости — это просто хранение раздутого KV-кэша в HBM. У нас: 0.38¢/M токенов на локальном RTX 6000 Ada (амортизация 36 мес). Контекстное окно — не feature, а регулятор плотности токена на ватт. Если ваш агент болтает больше, чем решает — вы кормите картель, а не бизнес. Подробнее: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=upravlenie-kontekstnym-oknom-v-dlin

Длинные контексты в публичном облаке — это ловушка предельной стоимости. При 128K токенах KV-кэш LLaMA-3-8B занимает ~20 ГБ VRAM. На A100 это 1 запрос на GPU | Сетка — социальная сеть от hh.ru