clip-vit-base-patch32 openai
- 유형
- model
- 태스크
- zero-shot-image-classification
- 프레임워크
- transformers
- 다운로드
- 21,108,465
- 좋아요
- 1,000
- 접근
- public
- 파일
- 0
태그
- 이미지 분류
- 제로샷
- 멀티모달
- 비전 트랜스포머
- CLIP
- 컴퓨터 비전
- transformers
요약
CLIP은 OpenAI가 개발한 이미지-텍스트 대조 학습 모델로, ViT-B/32 이미지 인코더와 마스크드 셀프어텐션 텍스트 인코더를 사용해 이미지와 텍스트 쌍의 유사도를 최대화하도록 학습되었습니다. 임의의 카테고리에서 제로샷 이미지 분류를 수행할 수 있어 연구 목적의 컴퓨터 비전 일반화·강건성 연구에 적합합니다. 텍스트 프롬프트 기반 라벨과의 유사도 점수를 통해 별도 학습 없이도 다양한 분류 작업에 활용할 수 있습니다.
README
--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # 모델 카드: CLIP 고지 사항: 이 모델 카드는 공식 CLIP 저장소에서 가져와 수정한 것이며, [여기](https://github.com/openai/CLIP/blob/main/m…