clip-vit-large-patch14 openai
- 種別
- model
- タスク
- zero-shot-image-classification
- フレームワーク
- transformers
- ダウンロード
- 6,921,737
- いいね
- 2,066
- アクセス
- public
- ファイル
- 0
タグ
- マルチモーダル
- 画像分類
- ゼロショット
- 視覚モデル
- コンピュータビジョン
- テキスト分類
- transformers
概要
画像エンコーダ(ViT-L/14)とテキストエンコーダを対比学習で訓練し、画像とテキストを同一の埋め込み空間に写像するマルチモーダルモデルです。追加学習なしで任意の画像分類をゼロショットで実行でき、画像検索や画像キャプションの評価などに活用されます。主に研究者向けの研究用途を想定しており、商用展開や監視・顔認識用途は対象外とされています。
README
--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # モデルカード: CLIP 免責事項: このモデルカードは公式CLIPリポジトリから取得・改変したもので、[こちら](https://github.com/openai/CLIP/blob/main/mod…