Трансформатор видения с пакетной нормой - На пути к науке о данных
•BatchNorm ускоряет конвергенцию и повышает стабильность сети. •В ViTBNFFN пакетная норма вводится в сеть прямой связи (FFN). •В стандартном ViT LayerNorm используется перед FFN. •ViTBNFFN имеет ту же архитектуру, что и стандартный ViT, но с пакетной нормой в FFN. •Пакетная норма вводится между первым линейным слоем и активацией GELU. •В стандартном ViT LayerNorm перед FFN удаляется. •Обучение и тестирование моделей на наборе данных MNIST с дополнениями. •Сравнение точности моделей ViT и ViTBNFFN на разных глубинах кодера. •ViTBNFFN сходится быстрее при достаточной глубине кодера. •ViTBNFFN более устойчив к высокой скорости обучения при достаточной глубине кодера. •ViT с высокой скоростью обучения достигает более низкой точности. •ViTBNFFN обеспечивает более высокую точность и быструю конвергенцию.
Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.