LocateAnything-3B nvidia

类型
model
任务
image-text-to-text
框架
transformers
下载量
186,844
点赞
2,913
访问
public
文件
0

标签

  • 视觉语言模型
  • 目标检测
  • 多模态
  • 图像分割
  • 视觉问答
  • transformers
  • 位置检测
  • 计算机视觉

摘要

LocateAnything-3B是NVIDIA开发的视觉语言模型,采用并行框解码(PBD)技术在单步并行预测完整边界框坐标,实现快速且高质量的视觉定位,吞吐量较此前方法提升约2.5倍。模型支持指代表达定位、多目标目标检测、GUI元素定位与文本定位等任务,广泛应用于机器人、自动驾驶、GUI交互、文档理解等场景。该模型基于Qwen2.5-3B-Instruct与MoonViT构建,仅限非商业研究用途。

README

--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…

查看完整页面 · 查看原文