Пошаговое руководство на Бумаге: Все, Что Вам Нужно - Это Внимание к Науке О Данных

•Трансформатор был представлен в 2017 году и предназначен для задач seq2seq. •Состоит из Encoder и Decoder, которые обрабатывают входные и выходные данные соответственно. •Включает многозадачный блок внимания для фиксации долгосрочных зависимостей. •Encoder и Decoder состоят из множества компонентов, включая позиционное кодирование и линейные слои. •Позиционное кодирование сохраняет информацию о последовательности. •Линейные слои включают прямую трансляцию и Softmax. •Импортируются необходимые модули и инициализируются параметры модели. •Параметры включают SEQLENGTH, VOCABSIZESRC и VOCABSIZEDST, BATCHSIZE, DMODEL, NUMHEADS, HIDDENDIM, N и DROPPROB. •Входные и выходные данные преобразуются в 512-мерные векторы. •Входные данные обрабатываются для исходного предложения, а выходные данные — для переведенного. •Позиционное кодирование добавляет значения к тензору встраивания. •Используется синусоидальная и косинусоидальная волны для сохранения информации о положении токенов. •Три многоголовых блока внимания имеют одинаковую структуру. •Включает масштабируемое внимание к точечному продукту и маску для просмотра в будущее. •Масштабируемое внимание к точечному продукту выполняет умножение и масштабирование, а также softmax. •Маска для просмотра в будущее используется для предотвращения распознавания последующих слов.

читать материал полностью

Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.