一、项目概况

DeepSeek-OCR 由 DeepSeek-AI 团队于 2025 年 10 月 20 日开源,旨在从“以 LLM 为中心”的视角重新思考视觉编码器在文档 OCR 中的作用。该模型通过将高分辨率图像压缩为极少量视觉 token(最低 64 个),在保持高准确率的同时显著降低推理延迟与显存占用,支持 Tiny/Small/Base/Large 四档原生分辨率及动态分辨率模式。

二、核心原理

  1. 上下文光学压缩(Contexts Optical Compression)
    模型在视觉编码阶段引入“上下文感知”压缩模块,对整页文档一次性编码,利用 Transformer 自注意力机制将 512×512~1280×1280 的输入图像映射为 64~400 个视觉 token,实现 20× 以上的信息压缩率。

  2. LLM-centric 架构
    压缩后的视觉 token 直接送入大语言模型(LLM)上下文窗口,与文本 token 统一处理,无需额外检测/分割后处理,实现“端到端”的版面还原与 Markdown 转换。

  3. 分级量化策略
    通过对不同分辨率、不同压缩率进行分级训练,模型在 Fox benchmark 上 0.15~0.25 编辑距离区间内取得 96.8% 以上准确率,显存占用低于同规模模型 10× 以上。

三、安装与推理

  1. 环境准备
    官方提供 conda 环境文件,要求 Python 3.12.9、PyTorch 2.6.0、vLLM 0.8.5+cu118、Flash-Attention 2.7.3,支持 A100-40G 单卡并发 2500 tokens/s。

  2. 两种推理方式

    • vLLM 模式:适合高并发生产,支持单图、PDF 批量,已封装 streaming 与 benchmark 脚本。

    • Transformers 模式:适合研究调试,通过 AutoModel/AutoTokenizer 两行代码加载,支持 flash_attention_2 加速。

  3. 使用示例
    提供 6 组提示模板,包括“Convert the document to markdown”、“Free OCR”、“Parse the figures”等,用户只需替换 <image> 路径即可输出结构化 Markdown。

四、性能表现

  1. Fox benchmark
    DeepSeek-OCR-Large 在 400 vision tokens 条件下编辑距离 <0.15,准确率 97.3%;Tiny 版仅用 64 vision tokens 即可达到 79.3%,优于 GOT-OCR2.0、Qwen2.5-VL-7B 等模型。

  2. OmniDocBench
    在真实文档版面还原任务中,Large 版平均编辑距离 0.17,显存占用仅为 InternVL2-76B 的 1/10;并发速度提升 15× 以上。

  3. 压缩率-准确率权衡
    实验表明,当单页视觉 token ≤1000 时,模型仍能保持 <0.25 编辑距离;token 数降至 1500 以上时,准确率下降梯度趋缓,证明压缩策略有效。

五、总结与展望

DeepSeek-OCR 通过“上下文光学压缩”首次在 512×512 分辨率下把视觉 token 压至 64 个,同时维持 96% 以上识别准确率,为移动端、实时扫描等场景提供新思路。未来工作将探索多语言、多栏、手写体等更复杂版式的压缩极限,并开源更大规模训练数据与量化方案。

六、核心技术汇总

在这里插入图片描述

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐