vit-base-patch16-224 google

種別
model
タスク
image-classification
フレームワーク
transformers
ダウンロード
4,801,412
いいね
991
アクセス
public
ファイル
0

タグ

  • 画像分類
  • コンピュータビジョン
  • 視覚モデル
  • 基盤モデル
  • 転移学習
  • 特徴抽出
  • transformers
  • PyTorch

概要

ViT(Vision Transformer)はBERT風のTransformerエンコーダーを画像に適用し、画像を16×16のパッチに分割して処理する基盤的な画像分類モデルです。ImageNet-21kで事前学習後、ImageNet-1kで微調整され、1,000クラスの画像分類タスクに対応します。画像分類だけでなく、事前学習済みエンコーダーの特徴抽出を活用した下流タスク(転移学習)にも広く利用できます。224×224解像度入力を前提とした軽量で汎用性の高い視覚基盤モデルです。

README

--- license: apache-2.0 tags: - vision - image-classification datasets: - imagenet-1k - imagenet-21k widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/tiger.jpg example_title: Tiger - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/teapot.jpg ex…

查看完整页面 · 查看原文