LocateAnything-3B nvidia
- Typ
- model
- Aufgabe
- image-text-to-text
- Framework
- transformers
- Downloads
- 186,844
- Likes
- 2,913
- Zugriff
- public
- Dateien
- 0
Tags
- 多模态
- 视觉模型
- 视觉问答
- 大语言模型
- 图像生成
- 机器学习
- 深度学习
- transformers
Zusammenfassung
LocateAnything-3B ist ein vision-sprachliches Modell (VLM) von NVIDIA für schnelles und qualitativ hochwertiges visuelles Grounding. Die Kerninnovation "Parallel Box Decoding" sagt Bounding-Box-Koordinaten in einem einzigen parallelen Schritt voraus, statt autoregressiv Token für Token, und erreich…
README
--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…