clip-vit-base-patch32 openai

Tipo
model
Tarea
zero-shot-image-classification
Framework
transformers
Descargas
21,108,465
Me gusta
1,000
Acceso
public
Archivos
0

Etiquetas

  • clasificación de imágenes
  • cero disparos
  • multimodal
  • visión por computadora
  • imagen a texto
  • modelo visual
  • transformers
  • PyTorch

Resumen

CLIP es un modelo de visión por computadora desarrollado por OpenAI que aprende representaciones conjuntas de imágenes y texto mediante aprendizaje contrastivo. Utiliza un codificador de imágenes ViT-B/32 y un codificador de texto con transformador de auto-atención enmascarada para maximizar la sim…

README

--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # Model Card: CLIP Descargo de responsabilidad: La tarjeta del modelo está tomada y modificada del repos…

查看完整页面 · 查看原文