vit-base-patch16-224 google
- 类型
- model
- 任务
- image-classification
- 框架
- transformers
- 下载量
- 4,801,412
- 点赞
- 991
- 访问
- public
- 文件
- 0
标签
- 图像分类
- 视觉模型
- 计算机视觉
- transformers
- 深度学习
- PyTorch
- 预训练
摘要
该模型是谷歌推出的Vision Transformer(ViT)基础版,在ImageNet-21k(1400万张图、21843类)上预训练,并在ImageNet-2012(100万张图、1000类)上微调,用于224x224分辨率下的图像分类任务。它把图像切分为16x16的固定大小补丁并线性嵌入,配合[CLS]标记实现分类,可用作下游视觉任务的特征提取骨干网络。适用于通用图像分类,也可通过在其上添加线性层迁移到其他有标签图像任务。
README
--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…