MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
Apple выпустила невероятно быстрые модели Core ML и приложение для iOS, позволяющее запускать их на iPhone!
Эти модели можно подключить к демо приложению, представленному в официальном репозитории MobileCLIP.
S0 соответствует ViT-B/ 16 от OpenAI, но в 4,8 раза быстрее и в 2,8 раза меньше размером.
S2 превосходит ViT-B/16 от SigLIP в 2,3 раза, при этом в 2,1 раза меньше по размеру, при этом используется для обучения в 3 раза меньше данных.
MobileCLIP-B(LT) достигает 77,2%-ную точность обработки изображений, превосходя DFN, SigLIP и даже ViT-L/14@336 от OpenAI.
conda create -n clipenv python=3.10 conda activate clipenv pip install -e
Python import torch from PIL import Image import mobileclip