DeepSeek-OCR deepseek-ai
- 类型
- model
- 任务
- image-text-to-text
- 框架
- transformers
- 下载量
- 2,306,029
- 点赞
- 3,338
- 访问
- public
- 文件
- 0
标签
- OCR
- 文档解析
- 视觉语言模型
- 多模态
- 视觉模型
- transformers
- vLLM
- 文本生成
摘要
DeepSeek-OCR 是一个视觉语言模型,专注于光学字符识别(OCR)与文档解析,可将扫描文档、表格等图像内容转换为 markdown 等结构化文本,并支持"上下文光学压缩"以提升长文档处理效率。它支持免费 OCR、文档转 markdown、grounding 等多种任务,并已获得 vLLM 官方支持以加速推理。适用于文档数字化、表格提取、PDF 解析等场景。
README
--- pipeline_tag: image-text-to-text language: - multilingual tags: - deepseek - vision-language - ocr - custom_code license: mit library_name: transformers --- <div align="center"> <img src="https://github.com/deepseek-ai/DeepSeek-V2/blob/main/figures/logo.svg?raw=true" width="60%" alt="DeepSeek A…