KV-кэш хранит вычисления, а не воспоминания
Языковая модель пишет ответ по одному токену, и каждый новый фрагмент должен учитывать предыдущие. Наивный путь — на каждом шаге заново вычислять служебные представления всех уже прочитанных токенов. Поэтому системы сохраняют их в KV-кэше: «ключи» и «значения» механизма внимания используются повторно, а вычисления добавляются только для свежего токена.
Это ускоряет генерацию, но занимает память ускорителя. Чем длиннее контекст и больше одновременных диалогов, тем тяжелее кэш. И главное: KV-кэш не хранит знания о вас — это временный технический след текущего вычисления.