vit-base-patch16-224 google

Tipo
model
Tarea
image-classification
Framework
transformers
Descargas
4,801,412
Me gusta
991
Acceso
public
Archivos
0

Etiquetas

  • clasificación de imágenes
  • visión por computadora
  • transformers
  • modelo visual
  • preentrenamiento
  • PyTorch

Resumen

El Vision Transformer (ViT) trata las imágenes como secuencias de parches de 16x16 píxeles procesados por un codificador transformer, inspirado en BERT. Preentrenado en ImageNet-21k y ajustado en ImageNet-1k para clasificar imágenes en 1000 clases, sirve para extraer características visuales y entr…

README

--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…

查看完整页面 · 查看原文