vit-base-patch16-224 google

유형
model
태스크
image-classification
프레임워크
transformers
다운로드
4,801,412
좋아요
991
접근
public
파일
0

태그

  • 이미지 분류
  • 컴퓨터 비전
  • 비전 트랜스포머
  • transformers
  • 파운데이션 모델

요약

Google이 공개한 Vision Transformer(ViT) 베이스 모델로, 이미지를 16x16 패치 시퀀스로 처리해 이미지 분류를 수행합니다. ImageNet-21k에서 사전학습 후 ImageNet-1k로 파인튜닝되어 1,000개 클래스를 분류하며, 사전학습 인코더의 특징을 다양한 다운스트림 비전 작업에 활용할 수 있습니다. 듀얼 임베딩과 [CLS] 토큰 기반 분류 구조로 컴퓨터 비전의 파운데이션 모델 역할을 합니다.

README

--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…

查看完整页面 · 查看原文