clip-vit-large-patch14 openai

类型
model
任务
zero-shot-image-classification
框架
transformers
下载量
6,921,737
点赞
2,066
访问
public
文件
0

标签

  • 多模态
  • 零样本学习
  • 图像分类
  • 计算机视觉
  • 视觉模型
  • 文本嵌入
  • transformers
  • 语义相似度

摘要

该模型是 OpenAI 开发的 CLIP 变体,采用 ViT-L/14 作为图像编码器和 Transformer 作为文本编码器,通过对比学习最大化图文对相似度。主要用于零样本图像分类、图文检索与语义相似度计算等研究场景,能够在任意类别标签下直接进行分类而无需微调。面向 AI 研究者探索鲁棒性与泛化能力,尚不适合未经测试的商业部署。

README

--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # 模型卡:CLIP 免责声明:本模型卡取自并修改自 CLIP 官方仓库,原版可在[此处](https://github.com/openai/CLIP/blob/main/model-card.md)找到。…

查看完整页面 · 查看原文