clip-vit-large-patch14 openai
- Tipo
- model
- Tarea
- zero-shot-image-classification
- Framework
- transformers
- Descargas
- 6,921,737
- Me gusta
- 2,066
- Acceso
- public
- Archivos
- 0
Etiquetas
- clasificación de imágenes
- visión por computadora
- aprendizaje contrastivo
- cero disparos
- multimodal
- transformers
- PyTorch
Resumen
CLIP de OpenAI es un modelo contrastivo que empareja imágenes y texto mediante dos codificadores Transformer (ViT-L/14 para visión y Transformer enmascarado para texto) entrenados con pérdida contrastiva sobre pares imagen-caption. Resuelve clasificación de imágenes arbitrarias en modo cero disparo…
README
--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # Tarjeta del Modelo: CLIP Aviso: La tarjeta del modelo está tomada y modificada del repositorio oficial…