clip-vit-base-patch32 openai

유형
model
태스크
zero-shot-image-classification
프레임워크
transformers
다운로드
21,108,465
좋아요
1,000
접근
public
파일
0

태그

  • 이미지 분류
  • 제로샷
  • 멀티모달
  • 비전 트랜스포머
  • CLIP
  • 컴퓨터 비전
  • transformers

요약

CLIP은 OpenAI가 개발한 이미지-텍스트 대조 학습 모델로, ViT-B/32 이미지 인코더와 마스크드 셀프어텐션 텍스트 인코더를 사용해 이미지와 텍스트 쌍의 유사도를 최대화하도록 학습되었습니다. 임의의 카테고리에서 제로샷 이미지 분류를 수행할 수 있어 연구 목적의 컴퓨터 비전 일반화·강건성 연구에 적합합니다. 텍스트 프롬프트 기반 라벨과의 유사도 점수를 통해 별도 학습 없이도 다양한 분류 작업에 활용할 수 있습니다.

README

--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # 모델 카드: CLIP 고지 사항: 이 모델 카드는 공식 CLIP 저장소에서 가져와 수정한 것이며, [여기](https://github.com/openai/CLIP/blob/main/m…

查看完整页面 · 查看原文