LocateAnything-3B nvidia
- Tipo
- model
- Tarea
- image-text-to-text
- Framework
- transformers
- Descargas
- 186,844
- Me gusta
- 2,913
- Acceso
- public
- Archivos
- 0
Etiquetas
- visión lenguaje
- multimodal
- modelo de lenguaje
- detección de objetos
- visión por computadora
- transformers
- agente
Resumen
LocateAnything es un modelo de visión-lenguaje (3B) de NVIDIA para grounding visual, capaz de localizar objetos, detectar densamente y localización por puntos. Su innovación clave, Parallel Box Decoding (PBD), predice coordenadas de cajas en un solo paso en lugar de decodificación autoregresiva, lo…
README
--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…