От трансформаторов зрения до автоэнкодеров в масках за 5 минут

• Задачи НЛП были успешно применены к компьютерному зрению с использованием архитектуры transformer. • Vision transformer - это обобщение стандартной архитектуры transformer для обработки изображений. • Vision transformer использует стандартный трансформатор для обработки векторов исправлений и возвращает векторы контекстного встраивания. • Vision transformer делит изображение на k2 фрагментов и сглаживает каждый патч в вектор. • Остальные операции выполняются аналогично исходному преобразователю transformer encoder. • Vision transformers могут использоваться для классификации на уровне патча или изображения. • Vision transformers не всегда превосходят модели на основе CNN, но требуют меньше вычислительных затрат. • Предварительная тренировка с использованием маскировки может привести к значительным улучшениям в производительности vision transformers.

читать материал полностью