clip-vit-large-patch14 openai
- 类型
- model
- 任务
- zero-shot-image-classification
- 框架
- transformers
- 下载量
- 6,921,737
- 点赞
- 2,066
- 访问
- public
- 文件
- 0
标签
- 多模态
- 零样本学习
- 图像分类
- 计算机视觉
- 视觉模型
- 文本嵌入
- transformers
- 语义相似度
摘要
该模型是 OpenAI 开发的 CLIP 变体,采用 ViT-L/14 作为图像编码器和 Transformer 作为文本编码器,通过对比学习最大化图文对相似度。主要用于零样本图像分类、图文检索与语义相似度计算等研究场景,能够在任意类别标签下直接进行分类而无需微调。面向 AI 研究者探索鲁棒性与泛化能力,尚不适合未经测试的商业部署。
README
--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # 模型卡:CLIP 免责声明:本模型卡取自并修改自 CLIP 官方仓库,原版可在[此处](https://github.com/openai/CLIP/blob/main/model-card.md)找到。…