LocateAnything-3B nvidia

Typ
model
Aufgabe
image-text-to-text
Framework
transformers
Downloads
186,844
Likes
2,913
Zugriff
public
Dateien
0

Tags

  • 多模态
  • 视觉模型
  • 视觉问答
  • 大语言模型
  • 图像生成
  • 机器学习
  • 深度学习
  • transformers

Zusammenfassung

LocateAnything-3B ist ein vision-sprachliches Modell (VLM) von NVIDIA für schnelles und qualitativ hochwertiges visuelles Grounding. Die Kerninnovation "Parallel Box Decoding" sagt Bounding-Box-Koordinaten in einem einzigen parallelen Schritt voraus, statt autoregressiv Token für Token, und erreich…

README

--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…

查看完整页面 · 查看原文