DeepSeek-OCR:用“一张图”压缩千言万语,让大模型记住更久的历史

“A picture is worth a thousand words.”
—— 而 DeepSeek-OCR 说:“一张图,还能省下 90% 的 token。”

在大语言模型(LLM)日益强大的今天,一个老问题却愈发尖锐:上下文太长,算不动了。序列长度呈平方级增长的计算开销,让处理整本书、长对话历史或复杂文档变得昂贵甚至不可行。

DeepSeek-AI 最新推出的 DeepSeek-OCR,提出了一种极具想象力的解决方案:把文本“画”成图,用视觉模态来压缩语言信息。这不是为了 OCR 而做 OCR,而是借 OCR 任务,探索一种全新的 “光学上下文压缩”(Optical Context Compression) 范式。


一、核心思想:视觉即压缩器

论文开宗明义:一张包含文档文本的图像,可以用远少于原始文本的视觉 token 来表示。例如,1000 个文字可能只需 100 个视觉 token —— 这就是 10 倍压缩

DeepSeek-OCR 将这一想法落地为一个端到端的视觉语言模型(VLM),由两部分组成:

  • DeepEncoder:专为高分辨率、低激活、少 token 设计的新型视觉编码器;
  • DeepSeek3B-MoE:一个 30 亿参数的稀疏激活 MoE 解码器,负责从压缩后的视觉 token 中“还原”出原始文本。

💡 关键洞察:OCR 任务天然构成一个“压缩-解压”闭环——图像(压缩)→ 文本(解压),且有精确的评估指标(字符准确率、编辑距离)。


二、技术亮点:DeepEncoder 如何做到“又快又省”?

现有 VLM 的视觉编码器在处理高分辨率文档时,往往面临三大困境:

  1. token 太多(如 InternVL 系列动辄上千 token);
  2. 显存爆炸(如 Qwen-VL 全图输入激活过大);
  3. 部署复杂(如 Vary 需双路预处理)。

DeepEncoder 的设计巧妙绕开这些问题:

  • 前半段:用 SAM-base(80M) 做局部感知,基于窗口注意力处理高分辨率图像(如 1024×1024 → 4096 patch);
  • 中间:插入一个 16× 卷积压缩器(两层 stride=2 的 conv),将 token 从 4096 压到 256;
  • 后半段:用 CLIP-large(300M) 做全局理解,但输入已是压缩后的低 token 序列,显存可控。

结果:高分辨率输入 + 低激活内存 + 极少视觉 token,三者兼得。

此外,DeepEncoder 支持 多分辨率模式(Tiny/Small/Base/Large/Gundam),从 64 到 1800+ token 灵活适配不同文档复杂度。


三、性能惊人:用更少 token,做到更强 OCR

OmniDocBench 基准上,DeepSeek-OCR 展现出压倒性优势:

模型 视觉 token / 页 编辑距离(越低越好)
GOT-OCR2.0 256 0.287
MinerU2.0 ~6790 0.133
DeepSeek-OCR (Small) 100 0.221
DeepSeek-OCR (Gundam-M) 1853 0.123

仅用 100 个 token 就超过 GOT-OCR2.0;用不到 800 token,干翻需要 7000+ token 的 MinerU2.0!

Fox 基准 的压缩实验中更令人振奋:

  • 压缩比 <10×(如 1000 文本 token → 100 视觉 token):OCR 精度达 97%
  • 压缩比 20×:精度仍保持在 ~60%

这意味着:对于大多数文档,10 倍无损压缩是可行的


四、不止 OCR:它还能“深度解析”图表、公式、几何图

DeepSeek-OCR 被训练为支持 OCR 2.0 任务:

  • 图表 → 转为 HTML 表格;
  • 化学式 → 输出 SMILES 字符串;
  • 几何图 → 解析线段、坐标、类型;
  • 自然图像 → 生成密集描述(caption)。

通过统一提示(如 <image>\nParse the figure.),模型自动判断图像类型并输出结构化结果——这为科研、金融、教育等领域的文档智能解析打开了大门。


五、更大的野心:为 LLM 构建“光学记忆”

论文最富想象力的部分,是将 光学压缩人类记忆遗忘机制 类比:

  • 近期对话 → 高分辨率图像 → 高保真记忆;
  • 久远历史 → 逐步缩小图像 → token 减少 + 文字模糊 → 自然“遗忘”

如图所示:

时间 →     刚发生     1小时     1天      1周      1月      1年
清晰度 →  Crystal Clear → Clear → Blurry → Almost Gone
对应分辨率 → Gundam → Large → Base → Small → Tiny

这为构建 理论上无限长上下文 的 LLM 提供了一条新路径:用视觉 token 动态管理记忆密度


六、实用价值:每天处理 20 万页,助力大模型预训练

DeepSeek-OCR 不只是研究原型:

  • 单卡 A100-40G 可日处理 20 万+ 页面
  • 20 节点集群(160 张 A100)日产出 3300 万页 高质量 OCR 数据;
  • 开源代码与模型权重:github.com/deepseek-ai/DeepSeek-OCR

这些数据可直接用于 LLM/VLM 的预训练,极大降低构建多语言、多模态语料库的成本。


结语:一张图,开启长上下文新范式

DeepSeek-OCR 表明:视觉模态不仅是“看图说话”的工具,更是高效压缩语言信息的媒介。它挑战了“文本必须用文本 token 表示”的惯性思维,为解决 LLM 的长上下文瓶颈提供了全新视角。

未来,我们或许会看到:

  • 对话历史被“渲染”成滚动长图存入上下文;
  • 整本 PDF 以一张超图形式输入模型;
  • LLM 的“记忆”像人眼一样——近处清晰,远处模糊,但整体高效。

这不仅是 OCR 的进步,更是 多模态与语言模型融合的一次范式跃迁

“We don’t just read documents—we compress them into vision.”
—— DeepSeek-OCR


延伸阅读

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐