Qwen3-VL-8B-Instruct Qwen
- 类型
- model
- 任务
- image-text-to-text
- 框架
- transformers
- 下载量
- 5,033,841
- 点赞
- 1,047
- 访问
- public
- 文件
- 0
标签
- 多模态
- 视觉语言模型
- 视觉问答
- 文本生成
- Agent
- 大语言模型
- OCR
- transformers
摘要
Qwen3-VL-8B-Instruct是通义千问系列最强的视觉语言模型,支持图像和视频理解、视觉Agent操作、视觉编程、3D空间定位与长上下文视频理解。该模型在文本理解与生成、视觉感知与推理、OCR(32种语言)、STEM/数学推理等方面全面提升,原生支持256K上下文并具备Agent交互能力。适用于多模态对话、GUI自动化、文档解析、视频分析与空间推理等场景。
README
--- license: apache-2.0 pipeline_tag: image-text-to-text library_name: transformers --- <a href="https://chat.qwenlm.ai/" target="_blank" style="margin: 2px;"> <img alt="Chat" src="https://img.shields.io/badge/%F0%9F%92%9C%EF%B8%8F%20Qwen%20Chat%20-536af5" style="display: inline-block; vertical-ali…