vit-base-patch16-224 google
- 種別
- model
- タスク
- image-classification
- フレームワーク
- transformers
- ダウンロード
- 4,801,412
- いいね
- 991
- アクセス
- public
- ファイル
- 0
タグ
- 画像分類
- コンピュータビジョン
- 視覚モデル
- 基盤モデル
- 転移学習
- 特徴抽出
- transformers
- PyTorch
概要
ViT(Vision Transformer)はBERT風のTransformerエンコーダーを画像に適用し、画像を16×16のパッチに分割して処理する基盤的な画像分類モデルです。ImageNet-21kで事前学習後、ImageNet-1kで微調整され、1,000クラスの画像分類タスクに対応します。画像分類だけでなく、事前学習済みエンコーダーの特徴抽出を活用した下流タスク(転移学習)にも広く利用できます。224×224解像度入力を前提とした軽量で汎用性の高い視覚基盤モデルです。
README
--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…