DeepSeek-OCR deepseek-ai

类型
model
任务
image-text-to-text
框架
transformers
下载量
2,306,029
点赞
3,338
访问
public
文件
0

标签

  • OCR
  • 文档解析
  • 视觉语言模型
  • 多模态
  • 视觉模型
  • transformers
  • vLLM
  • 文本生成

摘要

DeepSeek-OCR 是一个视觉语言模型,专注于光学字符识别(OCR)与文档解析,可将扫描文档、表格等图像内容转换为 markdown 等结构化文本,并支持"上下文光学压缩"以提升长文档处理效率。它支持免费 OCR、文档转 markdown、grounding 等多种任务,并已获得 vLLM 官方支持以加速推理。适用于文档数字化、表格提取、PDF 解析等场景。

README

--- pipeline_tag: image-text-to-text language: - multilingual tags: - deepseek - vision-language - ocr - custom_code license: mit library_name: transformers --- <div align="center"> <img src="https://github.com/deepseek-ai/DeepSeek-V2/blob/main/figures/logo.svg?raw=true" width="60%" alt="DeepSeek A…

查看完整页面 · 查看原文