Qwen2.5-VL-3B-Instruct Qwen
- 类型
- model
- 任务
- image-text-to-text
- 框架
- transformers
- 下载量
- 7,129,922
- 点赞
- 685
- 访问
- public
- 文件
- 0
标签
- 多模态
- 视觉语言模型
- 视觉问答
- 文档解析
- 文生视频
- 文本生成
- Agent
- transformers
摘要
Qwen2.5-VL-3B-Instruct 是通义千问系列的多模态视觉语言模型,能够识别常见物体并深入分析图像中的文字、图表、图标和版面布局。该模型兼具视觉智能体能力,可动态调度工具实现计算机/手机操作,同时支持超1小时长视频理解、物体定位(边界框/点)、结构化JSON输出等功能。适用于文档解析、图表问答、视频内容分析、视觉Agent及金融商业等场景。
README
--- license_name: qwen-research license_link: https://huggingface.co/Qwen/Qwen2.5-VL-3B-Instruct/blob/main/LICENSE language: - en pipeline_tag: image-text-to-text tags: - multimodal library_name: transformers --- # Qwen2.5-VL-3B-Instruct <a href="https://chat.qwenlm.ai/" target="_blank" style="marg…