vit-base-patch16-224 google

类型
model
任务
image-classification
框架
transformers
下载量
4,801,412
点赞
991
访问
public
文件
0

标签

  • 图像分类
  • 视觉模型
  • 计算机视觉
  • transformers
  • 深度学习
  • PyTorch
  • 预训练

摘要

该模型是谷歌推出的Vision Transformer(ViT)基础版,在ImageNet-21k(1400万张图、21843类)上预训练,并在ImageNet-2012(100万张图、1000类)上微调,用于224x224分辨率下的图像分类任务。它把图像切分为16x16的固定大小补丁并线性嵌入,配合[CLS]标记实现分类,可用作下游视觉任务的特征提取骨干网络。适用于通用图像分类,也可通过在其上添加线性层迁移到其他有标签图像任务。

README

--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…

查看完整页面 · 查看原文