vit-base-patch16-224 google

Typ
model
Aufgabe
image-classification
Framework
transformers
Downloads
4,801,412
Likes
991
Zugriff
public
Dateien
0

Tags

  • 图像分类
  • 视觉模型
  • 计算机视觉
  • transformers
  • 深度学习
  • 图像嵌入

Zusammenfassung

Dieses Modell ist ein Vision Transformer (ViT), der auf ImageNet-21k vortrainiert und auf ImageNet-1k (1.000 Klassen) feinabgestimmt wurde. Es verarbeitet Bilder als Sequenzen von 16x16-Patch-Embeddings und wird typischerweise für Bildklassifikationsaufgaben eingesetzt. Das gelernte Bild-Encoder-Mo…

README

--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…

查看完整页面 · 查看原文