clip-vit-base-patch32 openai

类型
model
任务
zero-shot-image-classification
框架
transformers
下载量
21,108,465
点赞
1,000
访问
public
文件
0

标签

  • 多模态
  • 图像分类
  • 视觉模型
  • 计算机视觉
  • 深度学习
  • transformers
  • PyTorch
  • 零样本学习

摘要

该模型是 OpenAI 提出的 CLIP 多模态模型(ViT-B/32 版本),通过对比学习同时训练图像编码器和文本编码器,使图像与文本在语义空间中对齐。它支持零样本图像分类,即无需微调即可根据任意文本标签对图像进行分类,也能用于图文相似度计算等任务。主要面向研究场景,可用于探索零样本分类的鲁棒性、泛化能力及其偏见问题。

README

--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # 模型卡:CLIP 免责声明:此模型卡取自官方 CLIP 仓库并进行了修改,原始版本可在[此处](https://github.com/openai/CLIP/blob/main/model-card.md…

查看完整页面 · 查看原文