vit-base-patch16-224 google
- Tipo
- model
- Tarea
- image-classification
- Framework
- transformers
- Descargas
- 4,801,412
- Me gusta
- 991
- Acceso
- public
- Archivos
- 0
Etiquetas
- clasificación de imágenes
- visión por computadora
- transformers
- modelo visual
- preentrenamiento
- PyTorch
Resumen
El Vision Transformer (ViT) trata las imágenes como secuencias de parches de 16x16 píxeles procesados por un codificador transformer, inspirado en BERT. Preentrenado en ImageNet-21k y ajustado en ImageNet-1k para clasificar imágenes en 1000 clases, sirve para extraer características visuales y entr…
README
--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…