clip-vit-base-patch32 openai
- Tipo
- model
- Tarea
- zero-shot-image-classification
- Framework
- transformers
- Descargas
- 21,108,465
- Me gusta
- 1,000
- Acceso
- public
- Archivos
- 0
Etiquetas
- clasificación de imágenes
- cero disparos
- multimodal
- visión por computadora
- imagen a texto
- modelo visual
- transformers
- PyTorch
Resumen
CLIP es un modelo de visión por computadora desarrollado por OpenAI que aprende representaciones conjuntas de imágenes y texto mediante aprendizaje contrastivo. Utiliza un codificador de imágenes ViT-B/32 y un codificador de texto con transformador de auto-atención enmascarada para maximizar la sim…
README
--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # Model Card: CLIP Descargo de responsabilidad: La tarjeta del modelo está tomada y modificada del repos…