Qwen2.5-VL-7B-Instruct Qwen
- 类型
- model
- 任务
- image-text-to-text
- 框架
- transformers
- 下载量
- 9,373,502
- 点赞
- 1,677
- 访问
- public
- 文件
- 0
标签
- 多模态
- 视觉语言模型
- 大语言模型
- 视觉问答
- OCR
- 文档解析
- Agent
- transformers
摘要
Qwen2.5-VL-7B-Instruct 是阿里通义千问团队推出的7B参数视觉语言模型,能识别图像中的物体、文本、图表与版面,并理解长达1小时以上的视频。该模型具备视觉智能体能力,可推理并调用工具完成计算机与手机操作,支持以边界框或点进行目标定位,并输出结构化JSON结果,适用于文档解析、表格发票识别及金融商业等场景。
README
--- license: apache-2.0 language: - en pipeline_tag: image-text-to-text tags: - multimodal library_name: transformers --- # Qwen2.5-VL-7B-Instruct <a href="https://chat.qwenlm.ai/" target="_blank" style="margin: 2px;"> <img alt="Chat" src="https://img.shields.io/badge/%F0%9F%92%9C%EF%B8%8F%20Qwen%2…