Абстракция работы Attention (начиная с GPT-1)

В прошлом посте при абстрактном представлении механизма pre-LN я ввёл сущность писателя-Attention, который переписывает входящий текст книги. Теперь попробуем сделать абстрактное представление о принципах его работы и почему это совершило революцию при создании LLM. Введём понятие того, что данные, на которых мы планируем обучать нашу модель представлены в виде книги X0, например длиной 512 страниц. Писатель-Attention, получая книгу, прочитает её с разных точек зрения, что позволяет выделить несколько основных сюжетов в книге, например 8 штук (multi-head). Причём таким образом, чтобы длина каждого сюжета была равной, например, 64 страницы. Далее он работает с каждым из восьми пересказов параллельно, и присваивает веса (Q/K/V) каждому элементу текста: 1.      вес того, насколько сильно этот элемент ищет связь с другим элементом (Query, Q); 2.      вес того, насколько сильно этот элемент предлагает связь другим элементам (Key, K); 3.      вес того, насколько сильно этот элемент готов раскрыть содержание если связь к ним имеется (Value, V).

После этого писатель-Attention снова пересказывает сюжеты сохраняя ту же длину 64 страницы и оперируя значениями V, но так чтобы сделать акцент на тех элементах, у которых есть максимальная связь Q и K (attention weight). Таким образом у нас получается 8 вновь пересказанных сюжетов книги длиной по 64 страницы. Далее писатель-Attention собирает эти сюжеты в конечную книгу длиной 512 страниц, сохраняя единую ось повествования. Таким образом, писатель-Attention переработал книгу таким образом чтобы: 1.      Выделить сюжетные линии. 2.      Переписать каждую сюжетную линию таким образом, чтобы увеличить значимость ряда сущностей внутри сюжета.

Это и есть абстрактное представление того, как работает механизм Attention, который помог сделать сильный шаг в создании LLM типа GPT-1 в 2018 году. Данное абстрактное представление написано мной для более простого понимания принципа работы алгоритма LLM. И, возможно, в надежде на то, что такая аналогия поможет в работе над созданием всё более продвинутых моделей.   Ссылка на первый пост: https://www.linkedin.com/posts/tikhon-vergentev-298560202_abstraction-of-the-deep-learning-algorithm-activity-7505673153101168640-lav6?utm_source=share&utm_medium=member_desktop&rcm=ACoAADOyA5QBOf6MRb40roVQt9uKu5_vYJIb0WM

linkedin.com/in/tikhon-vergentev-298560202/