clip-vit-base-patch32 openai
- 类型
- model
- 任务
- zero-shot-image-classification
- 框架
- transformers
- 下载量
- 21,108,465
- 点赞
- 1,000
- 访问
- public
- 文件
- 0
标签
- 多模态
- 图像分类
- 视觉模型
- 计算机视觉
- 深度学习
- transformers
- PyTorch
- 零样本学习
摘要
该模型是 OpenAI 提出的 CLIP 多模态模型(ViT-B/32 版本),通过对比学习同时训练图像编码器和文本编码器,使图像与文本在语义空间中对齐。它支持零样本图像分类,即无需微调即可根据任意文本标签对图像进行分类,也能用于图文相似度计算等任务。主要面向研究场景,可用于探索零样本分类的鲁棒性、泛化能力及其偏见问题。
README
--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # 模型卡:CLIP 免责声明:此模型卡取自官方 CLIP 仓库并进行了修改,原始版本可在[此处](https://github.com/openai/CLIP/blob/main/model-card.md…