LocateAnything-3B nvidia

種別
model
タスク
image-text-to-text
フレームワーク
transformers
ダウンロード
186,844
いいね
2,913
アクセス
public
ファイル
0

タグ

  • マルチモーダル
  • 視覚モデル
  • 物体検出
  • グラウンディング
  • 大言語モデル
  • transformers
  • コンピュータビジョン
  • 生成AI

概要

LocateAnythingはNVIDIAが開発した視覚言語モデルで、自然言語命令に基づく高速かつ高品質な物体位置特定(視覚グラウンディング)を実現します。新型の並列ボックスデコードを採用し、従来比最大2.5倍のスループット向上を達成。参照表現グラウンディング、多物体検出、GUI要素位置特定、テキスト位置特定など多彩なタスクに対応し、ロボティクス、自動運転、文書理解など様々な分野で活用できます。

README

--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…

查看完整页面 · 查看原文