LocateAnything-3B nvidia
- 種別
- model
- タスク
- image-text-to-text
- フレームワーク
- transformers
- ダウンロード
- 186,844
- いいね
- 2,913
- アクセス
- public
- ファイル
- 0
タグ
- マルチモーダル
- 視覚モデル
- 物体検出
- グラウンディング
- 大言語モデル
- transformers
- コンピュータビジョン
- 生成AI
概要
LocateAnythingはNVIDIAが開発した視覚言語モデルで、自然言語命令に基づく高速かつ高品質な物体位置特定(視覚グラウンディング)を実現します。新型の並列ボックスデコードを採用し、従来比最大2.5倍のスループット向上を達成。参照表現グラウンディング、多物体検出、GUI要素位置特定、テキスト位置特定など多彩なタスクに対応し、ロボティクス、自動運転、文書理解など様々な分野で活用できます。
README
--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…