LocateAnything-3B nvidia
- 유형
- model
- 태스크
- image-text-to-text
- 프레임워크
- transformers
- 다운로드
- 186,844
- 좋아요
- 2,913
- 접근
- public
- 파일
- 0
태그
- 멀티모달
- 비전 언어 모델
- 이미지이해
- 객체 감지
- NLP
- transformers
요약
LocateAnything은 자연어 지시에 따라 이미지 속 객체를 빠르고 정밀하게 위치시키는 비전 언어 모델(VLM)입니다. 병렬 박스 디코딩(PBD)을 도입해 자동회귀 토큰 생성 대신 한 번에 경계박스를 예측하여 기존 대비 최대 2.5배 높은 처리량을 제공합니다. 객체 검출, 참조 표현 그라운딩, GUI 요소 그라운딩, 문서 이해, 로봇·자율주행 인식 등 다양한 도메인에 적용 가능하며, 연구 및 비상업적 목적으로만 사용할 수 있습니다.
README
--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…