Механизмы внимания в LLM
Сап! Вышла новая большая статья на LLMCrew 👀
На этот раз разобрался с тем, что буквально лежит в основе работы современных LLM - механизмами внимания и KV-cache. - как на самом деле работает Self-Attention; - откуда берутся Q, K и V и что они означают; - зачем модели нужен KV-cache и почему это не "память модели" в привычном смысле; - MHA, MQA, GQA и другие варианты Attention; - почему архитектура внимания напрямую влияет на VRAM, скорость инференса и длину контекста; - какие подходы используют современные модели в 2026 году. Постарался собрать всё в одну цельную картину: от базовой механики до того, с чем уже сталкиваешься при реальном инференсе больших моделей.
Если когда-нибудь хотелось наконец нормально понять, что происходит внутри LLM между вашим промптом и следующим токеном - добро пожаловать: https://llmcrew.org/wiki/attention-mechanisms-2026
Чат Ваш LLMCrew.org