vit-base-patch16-224 google
- 유형
- model
- 태스크
- image-classification
- 프레임워크
- transformers
- 다운로드
- 4,801,412
- 좋아요
- 991
- 접근
- public
- 파일
- 0
태그
- 이미지 분류
- 컴퓨터 비전
- 비전 트랜스포머
- transformers
- 파운데이션 모델
요약
Google이 공개한 Vision Transformer(ViT) 베이스 모델로, 이미지를 16x16 패치 시퀀스로 처리해 이미지 분류를 수행합니다. ImageNet-21k에서 사전학습 후 ImageNet-1k로 파인튜닝되어 1,000개 클래스를 분류하며, 사전학습 인코더의 특징을 다양한 다운스트림 비전 작업에 활용할 수 있습니다. 듀얼 임베딩과 [CLS] 토큰 기반 분류 구조로 컴퓨터 비전의 파운데이션 모델 역할을 합니다.
README
--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…