Локализация с нулевым разрешением с помощью кодеров в стиле CLIP - на пути к науке о данных

•Визуальные кодеры преобразуют изображения в трехмерное векторное пространство. •Карты объектов (w × h × k) можно рассматривать как двумерный массив k-мерных вставок патчей. •CNN и ViT преобразуют изображения в последовательность карт объектов. •Методы локализации с нулевым разрешением создают визуализации, понятные человеку. •Эти визуализации позволяют различать семантически связанные области на изображении. •Термин "нулевой выстрел" означает, что модель не была обучена аннотациям масок. •Карты активации классов (CAM) используют средневзвешенное значение каналов объектов для создания тепловой карты. •Grad-CAM обобщает CAM для любой архитектуры CNN. •CLIP обучается на большом открытом словарном запасе, что усложняет локализацию. •Подходы, такие как Grad-CAM и карты сходства патч-текста, терпят неудачу. •Карты самоконтроля показывают, что патчи не всегда семантически связаны с текстом. •GEM корректирует зашумленные карты внимания к ключевым запросам. •GEM использует "внимание к себе" для создания тепловых карт. •GEM создает тепловые карты для произвольных семантических классов.

читать материал полностью

Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.