LocateAnything-3B nvidia

Tipo
model
Tarea
image-text-to-text
Framework
transformers
Descargas
186,844
Me gusta
2,913
Acceso
public
Archivos
0

Etiquetas

  • visión lenguaje
  • multimodal
  • modelo de lenguaje
  • detección de objetos
  • visión por computadora
  • transformers
  • agente

Resumen

LocateAnything es un modelo de visión-lenguaje (3B) de NVIDIA para grounding visual, capaz de localizar objetos, detectar densamente y localización por puntos. Su innovación clave, Parallel Box Decoding (PBD), predice coordenadas de cajas en un solo paso en lugar de decodificación autoregresiva, lo…

README

--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…

查看完整页面 · 查看原文