题意:如何从CLIP模型中获得多模态嵌入?
问题背景:
I'm hoping to use CLIP to get a single embedding for rows of multimodal (image and text) data.
我希望使用CLIP来为多模态(图像和文本)数据行获取单一的嵌入表示。
Say I have the following model: 假设我有以下模型:
from PIL import Image
import torch
from transformers import CLIPProcessor, CLIPModel
import torchvision.transforms as transforms
model = CLIPModel.from_pretrained("openai/clip-vit-base-patch32")
processor = CLIPProcessor.from_pretrained("openai/clip-vit-base-patch32")
def convert_image_data_to_tensor(image_data):
return torch.tensor(image_data)
dataset = df[['image_data', 'text_data']].to_dict('records')
embeddings = []
for data
订阅专栏 解锁全文

431

被折叠的 条评论
为什么被折叠?



