MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training

Apple выпустила невероятно быстрые модели Core ML и приложение для iOS, позволяющее запускать их на iPhone!

Эти модели можно подключить к демо приложению, представленному в официальном репозитории MobileCLIP.

S0 соответствует ViT-B/ 16 от OpenAI, но в 4,8 раза быстрее и в 2,8 раза меньше размером.

S2 превосходит ViT-B/16 от SigLIP в 2,3 раза, при этом  в 2,1 раза меньше по размеру, при этом используется для обучения в 3 раза меньше данных.

MobileCLIP-B(LT) достигает 77,2%-ную точность обработки изображений, превосходя DFN, SigLIP и даже ViT-L/14@336 от OpenAI.

conda create -n clipenv python=3.10 conda activate clipenv pip install -e

Python import torch from PIL import Image import mobileclip

MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
Apple выпустила невероятно быстрые модели Core ML и приложение для iOS, позволяющее запускать их на iPhone!
Эти модели можно ... | Сетка — социальная сеть от hh.ru
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
Apple выпустила невероятно быстрые модели Core ML и приложение для iOS, позволяющее запускать их на iPhone!
Эти модели можно ... | Сетка — социальная сеть от hh.ru MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
Apple выпустила невероятно быстрые модели Core ML и приложение для iOS, позволяющее запускать их на iPhone!
Эти модели можно ... | Сетка — социальная сеть от hh.ru