clip-vit-large-patch14 openai

Tipo
model
Tarea
zero-shot-image-classification
Framework
transformers
Descargas
6,921,737
Me gusta
2,066
Acceso
public
Archivos
0

Etiquetas

  • clasificación de imágenes
  • visión por computadora
  • aprendizaje contrastivo
  • cero disparos
  • multimodal
  • transformers
  • PyTorch

Resumen

CLIP de OpenAI es un modelo contrastivo que empareja imágenes y texto mediante dos codificadores Transformer (ViT-L/14 para visión y Transformer enmascarado para texto) entrenados con pérdida contrastiva sobre pares imagen-caption. Resuelve clasificación de imágenes arbitrarias en modo cero disparo…

README

--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # Tarjeta del Modelo: CLIP Aviso: La tarjeta del modelo está tomada y modificada del repositorio oficial…

查看完整页面 · 查看原文