KV-кэш хранит вычисления, а не воспоминания

Языковая модель пишет ответ по одному токену, и каждый новый фрагмент должен учитывать предыдущие. Наивный путь — на каждом шаге заново вычислять служебные представления всех уже прочитанных токенов. Поэтому системы сохраняют их в KV-кэше: «ключи» и «значения» механизма внимания используются повторно, а вычисления добавляются только для свежего токена.

Это ускоряет генерацию, но занимает память ускорителя. Чем длиннее контекст и больше одновременных диалогов, тем тяжелее кэш. И главное: KV-кэш не хранит знания о вас — это временный технический след текущего вычисления.

#ИИпростымиСловами #LLM #КакЭтоРаботает

KV-кэш хранит вычисления, а не воспоминания
Языковая модель пишет ответ по одному токену, и каждый новый фрагмент должен учитывать предыдущие | Сетка — социальная сеть от hh.ru