vit-base-patch16-224 google
- Typ
- model
- Aufgabe
- image-classification
- Framework
- transformers
- Downloads
- 4,801,412
- Likes
- 991
- Zugriff
- public
- Dateien
- 0
Tags
- 图像分类
- 视觉模型
- 计算机视觉
- transformers
- 深度学习
- 图像嵌入
Zusammenfassung
Dieses Modell ist ein Vision Transformer (ViT), der auf ImageNet-21k vortrainiert und auf ImageNet-1k (1.000 Klassen) feinabgestimmt wurde. Es verarbeitet Bilder als Sequenzen von 16x16-Patch-Embeddings und wird typischerweise für Bildklassifikationsaufgaben eingesetzt. Das gelernte Bild-Encoder-Mo…
README
--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…