🧠 AI: за кулисами "разума" 🧠
Глава 6: Архитектура LLM — как устроена «нервная система» модели 🏗️
Теперь соберём всё вместе и посмотрим на архитектуру LLM целиком — от входа до выхода. 🚗 Если трансформер из главы 3 — это «двигатель», то здесь мы посмотрим на весь «автомобиль». С приборной панелью, тормозами и той странной кнопкой, назначение которой никто не помнит. 🛠️
Эмбеддинг-слой — «приёмная» модели. 📥 Каждый токен получает вектор из специальной таблицы (embedding matrix). В 2026 году размерность эмбеддингов у флагманских моделей — 4096–8192 измерений: каждый токен описывается тысячами чисел. 🔢 Попробуйте объяснить модели, что «понедельник» — это не просто слово, а 4096 чисел, из которых примерно 2000 отвечают за «тяжесть», а остальные — за «не хочу». 🤯 Позиционная информация передаётся через RoPE: он вращает Query и Key внутри attention, а не добавляется к эмбеддингу токена. Один и тот же токен может означать разное в зависимости от контекста — именно поэтому после эмбеддингов нужен трансформер. 🗞️
Стек трансформер-блоков — «кора» модели. 🧱 Эмбеддинги проходят через стек из N блоков. У GPT-5 было 120 слоёв. У GPT-6 Astra — не просто больше слоёв, а рекуррентная глубина (Looped Transformer): информация многократно прогоняется через один и тот же блок. 🔁 У DeepSeek V4 Pro — 61 слой с 384 маршрутизируемыми экспертами MoE в каждом. Названия условные, но порядок цифр отражает реальный масштаб. Каждый блок содержит self-attention и feed-forward сеть (FFN), про которые мы говорили в главе 3. Но здесь появляются новые детали:
Grouped-Query Attention (GQA) — в 2026 году стала стандартом де-факто. 🔗 Модель использует несколько «голов запроса» (query heads), которые делят общие «ключи» и «значения». Это уменьшает объём KV-кэша в 4–8 раз почти без потери качества — критично для длинных контекстов и экономии видеопамяти. 💾 Простыми словами: раньше у каждой головы запроса был свой личный кабинет, теперь они делят офис — но работают так же хорошо. 👍 GQA — компромисс между multi-head attention (дорого по памяти) и multi-query attention (дёшево, но качество страдает). 🗞️
RMSNorm вместо LayerNorm — в 2026 году стала стандартом во многих моделях, хотя LayerNorm ещё встречается. ⚡ Она быстрее и эффективнее: не нужно вычитать среднее, только масштабировать по среднеквадратичному значению. Мелочь, а на масштабе в сотни слоёв — существенная экономия. Это как заменить чайные пакетики в индивидуальной упаковке на большой заварочный чайник: вкус тот же, а мусора меньше. 🗞️
Между компонентами стоят остаточные связи (residual connections), которые «пробрасывают» информацию через слои без искажений, чтобы сеть не «забывала» важные признаки. 🔄 Это как эстафетная палочка, которую передают от этажа к этажу, и никто не имеет права её уронить. Без них градиенты затухали бы к нижним слоям, и модель не смогла бы обучиться. 🗞️
Unembedding — выход в словарь. 📤 После последнего блока модель получает финальный вектор для последнего токена. Этот вектор умножается на матрицу unembedding, и получается логит для каждого токена в словаре. Логиты проходят через softmax и превращаются в вероятности. Словарь флагманских моделей в 2026 году — 128K–256K токенов. 📚 Для сравнения: активный словарь взрослого человека — около 20 тысяч слов. Модель знает в 10 раз больше слов, но всё равно путает «их» и «там». 😂 Видимо, некоторые вещи не лечатся масштабом. Матрица unembedding часто связана с матрицей эмбеддингов — это weight tying, и оно экономит параметры. 🗞️
Картинка целиком — в одной формуле: 🧮 Вход → токенизация → эмбеддинги → [Self-Attention + FFN + Norm + Residual] × N слоёв → unembedding → softmax → вероятности → выборка → декодирование. 🗞️
Немного юмора. 😄 Архитектура LLM — это многоэтажный дом, где каждый этаж (слой) добавляет своё понимание текста. 🏢 На первом этаже разбирают буквы, на десятом — синтаксис, на сотом — сарказм, а на двухсотом — когда собеседник говорит «ну да, конечно» и реально имеет в виду «нет». MoE — это когда на каждом этаже сидит комитет из экспертов, но лифт привозит документ только к двоим. И они даже не знают, что остальные существуют. Зато всё быстро и дёшево. 🗞️