clip-vit-large-patch14 openai

種別
model
タスク
zero-shot-image-classification
フレームワーク
transformers
ダウンロード
6,921,737
いいね
2,066
アクセス
public
ファイル
0

タグ

  • マルチモーダル
  • 画像分類
  • ゼロショット
  • 視覚モデル
  • コンピュータビジョン
  • テキスト分類
  • transformers

概要

画像エンコーダ(ViT-L/14)とテキストエンコーダを対比学習で訓練し、画像とテキストを同一の埋め込み空間に写像するマルチモーダルモデルです。追加学習なしで任意の画像分類をゼロショットで実行でき、画像検索や画像キャプションの評価などに活用されます。主に研究者向けの研究用途を想定しており、商用展開や監視・顔認識用途は対象外とされています。

README

--- tags: - vision widget: - src: https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png candidate_labels: playing music, playing sports example_title: Cat & Dog --- # モデルカード: CLIP 免責事項: このモデルカードは公式CLIPリポジトリから取得・改変したもので、[こちら](https://github.com/openai/CLIP/blob/main/mod…

查看完整页面 · 查看原文