🧠 AI: за кулисами "разума" 🧠
Глава 4: Трансформер — оптимизации и альтернативы
🧠 К 2026 году трансформер заметно эволюционировал. Самое важное изменение — Mixture of Experts (MoE). Вместо того чтобы каждый токен активировал все нейроны модели, специальный «маршрутизатор» (router) выбирает 2–4 «эксперта» из десятков и направляет токен только к ним. Результат: модель с триллионом параметров работает со скоростью модели на 50 млрд. Правда, есть нюанс: по вычислениям это действительно дёшево, но все эксперты всё равно нужно где-то хранить, поэтому требования к памяти остаются высокими. Именно так устроены Kimi K2.6, DeepSeek V4 Pro и многие другие флагманские модели 2026 года. Это как если бы в компании работало 128 специалистов, но каждая задача автоматически попадала только к двоим — а остальные 126 в это время «отдыхали» 😴. Эффективность — мечта любого менеджера. 🗞️
⚖️ Кстати, у MoE есть и обратная сторона: маршрутизатор нужно обучить так, чтобы нагрузка распределялась равномерно. Иначе возникает «схлопывание» — все токены уходят к одним и тем же экспертам, а остальные простаивают без дела. С этим борются через auxiliary loss и принудительную балансировку. То есть даже у идеи «пусть работает не всё сразу» есть свои менеджерские проблемы: кого-то всё равно приходится заставлять работать. 🗞️
⚡ Оптимизация внимания тоже шагнула вперёд: FlashAttention-3 ускоряет вычисления на GPU, RoPE позволяет экстраполировать контекст до 1M+ токенов, а KV-caching переиспользует предыдущие вычисления, чтобы модель не «перечитывала» весь промпт для каждого нового токена. KV-кэш — это как закладка в книге 🔖: вместо того чтобы перечитывать с начала, модель просто открывает там, где остановилась. Правда, у закладки есть цена: чем длиннее контекст, тем больше памяти она занимает, поэтому KV-кэш тоже оптимизируют — сжимают, квантуют, выбрасывают наименее важное. 🗞️
📈 Но у трансформеров есть фундаментальная проблема: квадратичная сложность. Удвоение контекста учетверяет вычисления. Это как если бы каждое новое письмо в почте замедляло ответ на все остальные. Инженеры пытались решить это промежуточными шагами: sparse attention — модель «смотрит» не на все токены, а только на подмножество (например, ближайших 1024). Sliding window attention — окно фиксированного размера, которое скользит по тексту. Эти подходы снижают сложность, но теряют дальние связи: модель «видит» соседей, но забывает, что было в начале документа. Полумера — лучше, чем ничего, но не решение. 🗞️
🚀 И в 2026 году появились реальные альтернативы:
🐍 Mamba и State Space Models (SSM): линейное масштабирование вместо квадратичного. Модель может обрабатывать бесконечный контекст без замедления. Уже строятся гибридные архитектуры, смешивающие внимание трансформера с эффективностью Mamba. 🗞️
🧠 Titans от Google: добавляет долгосрочную и постоянную память наряду с краткосрочным вниманием. У модели есть «метрика сюрпризов»: чем неожиданнее данные, тем важнее их запомнить. Titans масштабируются до 2+ млн токенов без потери точности. Честно говоря, это уже ближе к тому, как работает человеческий мозг: мы тоже запоминаем необычное лучше, чем рутину. Хотя кого мы обманываем — мы запоминаем только то, что было смешным 😂.
🔁 RWKV: гибрид RNN и трансформера — эффективность рекуррентных сетей на инференсе плюс качество трансформеров на обучении. Произносится как «RWKV», потому что нормальное название придумать никто не успел — все были заняты обучением. 🗞️
😄 А теперь немного юмора. MoE — это когда в офисе 16 сотрудников, но каждое письмо автоматически попадает только к двоим, и они даже не подозревают о существовании остальных 14. Titans — это сотрудник с блокнотом 📓, который записывает туда только неожиданное и потом заглядывает в него при необходимости. Mamba — это сотрудник, который вообще не читает письма, а просто скользит по ним взглядом и почему-то всё понимает. Никто не знает как, но работает. А sparse attention — это сотрудник, который читает только каждое десятое письмо и уверен, что ничего не пропустил. Он пропустил, но выяснится это только на ретроспективе 🙈.