Абстракция работы FNN и MOE (начиная с DeepSeek-V3)

В прошлых постах я ввёл абстракцию, позволяющую представить принцип работы LLM типа GPT-3, в которой участником также был писатель-FNN, задача которого состоит в том, чтобы работать и переписывать входящий текст. Я бы хотел продолжить аналогию и сравнить её с MOE, которая позволяет значительно быстрее обрабатывать данные.

Предположим, что писатель-FNN принимает некоторую книгу на 512 страниц. Принцип работы, которому придерживается писатель-FNN, согласуется с принципом работы многослойной нейронной сети. Как это выглядит в нашей абстракции? Представим, что писатель-FNN не самостоятельно выполняет работу, а созванивается с маленькой типографией и отправляет книгу ей. Типографии может иметь всего 3 работника (количество слоёв), которые работают последовательно. Каждый работник маленькой типографии переписывает текст согласно своему восприятию и мировоззрению, основываясь на тексте от предыдущего работника, и конечный результат отправляют обратно писателю-FNN. Таким образом, весь текст книги был переработан полностью.   Алгоритм работы MOE (DeepSeek-V3) Теперь вместо писателя-FNN у нас есть писатель-MOE. Писатель-MOE оказался более хитрым и имеет в своём подчинении не маленькую типографию, а целую сеть маленьких типографий, например 256 штук, и одну центральную типографию (shared expert). При получении текста книги писатель-MOE вырезает из книги каждый элемент текста и отправляет своему помощнику-роутер (gating network), который сначала присваивает веса значимости каждому элементу текста, а потом назначает обработку каждого этого элемента центральной типографии и дополнительно 8 наиболее подходящим типографиям. В типографии полученный элемент текста последовательно каждый работник переписывает его согласно своему восприятию, и отправляет обратно писателю-MOE. Писатель-MOE получает обратно от 9 типографий по элементу переработанного текста (разная интерпретация одного исходного элемента), а затем сводит это к одному элементу текста (той же длины) через взвешенную сумму. В конечном итоге писатель-MOE получает обратно такой же набор, но уже переработанных элементов текста и объединяет их в единую книгу изначальной длины 512 страниц, но учитывая единую линию повествования.   Именно эта архитектура позволила DeepSeek-V3 (2024-12-26) достичь или превзойти уровень GPT-4о (2024-05-14) в математике, коде и других областях при затратах, составляющих малую долю от затрат на аналогичные модели. Данное абстрактное представление написано мной для более простого понимания принципа работы алгоритма LLM. И, возможно, в надежде на то, что такая аналогия поможет в работе над созданием всё более продвинутых моделей.   Ссылка на первый пост: https://lnkd.in/p/d2Z-XuDQ   linkedin.com/in/tikhon-vergentev-298560202/