LocateAnything-3B nvidia

유형
model
태스크
image-text-to-text
프레임워크
transformers
다운로드
186,844
좋아요
2,913
접근
public
파일
0

태그

  • 멀티모달
  • 비전 언어 모델
  • 이미지이해
  • 객체 감지
  • NLP
  • transformers

요약

LocateAnything은 자연어 지시에 따라 이미지 속 객체를 빠르고 정밀하게 위치시키는 비전 언어 모델(VLM)입니다. 병렬 박스 디코딩(PBD)을 도입해 자동회귀 토큰 생성 대신 한 번에 경계박스를 예측하여 기존 대비 최대 2.5배 높은 처리량을 제공합니다. 객체 검출, 참조 표현 그라운딩, GUI 요소 그라운딩, 문서 이해, 로봇·자율주행 인식 등 다양한 도메인에 적용 가능하며, 연구 및 비상업적 목적으로만 사용할 수 있습니다.

README

--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…

查看完整页面 · 查看原文