DeepSeek-OCR:用“一张图”压缩千言万语,让大模型记住更久的历史
DeepSeek-OCR:用“一张图”压缩千言万语,让大模型记住更久的历史
“A picture is worth a thousand words.”
—— 而 DeepSeek-OCR 说:“一张图,还能省下 90% 的 token。”
在大语言模型(LLM)日益强大的今天,一个老问题却愈发尖锐:上下文太长,算不动了。序列长度呈平方级增长的计算开销,让处理整本书、长对话历史或复杂文档变得昂贵甚至不可行。
DeepSeek-AI 最新推出的 DeepSeek-OCR,提出了一种极具想象力的解决方案:把文本“画”成图,用视觉模态来压缩语言信息。这不是为了 OCR 而做 OCR,而是借 OCR 任务,探索一种全新的 “光学上下文压缩”(Optical Context Compression) 范式。
一、核心思想:视觉即压缩器
论文开宗明义:一张包含文档文本的图像,可以用远少于原始文本的视觉 token 来表示。例如,1000 个文字可能只需 100 个视觉 token —— 这就是 10 倍压缩。
DeepSeek-OCR 将这一想法落地为一个端到端的视觉语言模型(VLM),由两部分组成:
- DeepEncoder:专为高分辨率、低激活、少 token 设计的新型视觉编码器;
- DeepSeek3B-MoE:一个 30 亿参数的稀疏激活 MoE 解码器,负责从压缩后的视觉 token 中“还原”出原始文本。
💡 关键洞察:OCR 任务天然构成一个“压缩-解压”闭环——图像(压缩)→ 文本(解压),且有精确的评估指标(字符准确率、编辑距离)。
二、技术亮点:DeepEncoder 如何做到“又快又省”?
现有 VLM 的视觉编码器在处理高分辨率文档时,往往面临三大困境:
- token 太多(如 InternVL 系列动辄上千 token);
- 显存爆炸(如 Qwen-VL 全图输入激活过大);
- 部署复杂(如 Vary 需双路预处理)。
DeepEncoder 的设计巧妙绕开这些问题:
- 前半段:用 SAM-base(80M) 做局部感知,基于窗口注意力处理高分辨率图像(如 1024×1024 → 4096 patch);
- 中间:插入一个 16× 卷积压缩器(两层 stride=2 的 conv),将 token 从 4096 压到 256;
- 后半段:用 CLIP-large(300M) 做全局理解,但输入已是压缩后的低 token 序列,显存可控。
结果:高分辨率输入 + 低激活内存 + 极少视觉 token,三者兼得。
此外,DeepEncoder 支持 多分辨率模式(Tiny/Small/Base/Large/Gundam),从 64 到 1800+ token 灵活适配不同文档复杂度。
三、性能惊人:用更少 token,做到更强 OCR
在 OmniDocBench 基准上,DeepSeek-OCR 展现出压倒性优势:
| 模型 | 视觉 token / 页 | 编辑距离(越低越好) |
|---|---|---|
| GOT-OCR2.0 | 256 | 0.287 |
| MinerU2.0 | ~6790 | 0.133 |
| DeepSeek-OCR (Small) | 100 | 0.221 ✅ |
| DeepSeek-OCR (Gundam-M) | 1853 | 0.123 ✅ |
✅ 仅用 100 个 token 就超过 GOT-OCR2.0;用不到 800 token,干翻需要 7000+ token 的 MinerU2.0!
在 Fox 基准 的压缩实验中更令人振奋:
- 压缩比 <10×(如 1000 文本 token → 100 视觉 token):OCR 精度达 97%;
- 压缩比 20×:精度仍保持在 ~60%。
这意味着:对于大多数文档,10 倍无损压缩是可行的。
四、不止 OCR:它还能“深度解析”图表、公式、几何图
DeepSeek-OCR 被训练为支持 OCR 2.0 任务:
- 图表 → 转为 HTML 表格;
- 化学式 → 输出 SMILES 字符串;
- 几何图 → 解析线段、坐标、类型;
- 自然图像 → 生成密集描述(caption)。
通过统一提示(如 <image>\nParse the figure.),模型自动判断图像类型并输出结构化结果——这为科研、金融、教育等领域的文档智能解析打开了大门。
五、更大的野心:为 LLM 构建“光学记忆”
论文最富想象力的部分,是将 光学压缩 与 人类记忆遗忘机制 类比:
- 近期对话 → 高分辨率图像 → 高保真记忆;
- 久远历史 → 逐步缩小图像 → token 减少 + 文字模糊 → 自然“遗忘”。
如图所示:
时间 → 刚发生 1小时 1天 1周 1月 1年
清晰度 → Crystal Clear → Clear → Blurry → Almost Gone
对应分辨率 → Gundam → Large → Base → Small → Tiny
这为构建 理论上无限长上下文 的 LLM 提供了一条新路径:用视觉 token 动态管理记忆密度。
六、实用价值:每天处理 20 万页,助力大模型预训练
DeepSeek-OCR 不只是研究原型:
- 单卡 A100-40G 可日处理 20 万+ 页面;
- 20 节点集群(160 张 A100)日产出 3300 万页 高质量 OCR 数据;
- 开源代码与模型权重:github.com/deepseek-ai/DeepSeek-OCR
这些数据可直接用于 LLM/VLM 的预训练,极大降低构建多语言、多模态语料库的成本。
结语:一张图,开启长上下文新范式
DeepSeek-OCR 表明:视觉模态不仅是“看图说话”的工具,更是高效压缩语言信息的媒介。它挑战了“文本必须用文本 token 表示”的惯性思维,为解决 LLM 的长上下文瓶颈提供了全新视角。
未来,我们或许会看到:
- 对话历史被“渲染”成滚动长图存入上下文;
- 整本 PDF 以一张超图形式输入模型;
- LLM 的“记忆”像人眼一样——近处清晰,远处模糊,但整体高效。
这不仅是 OCR 的进步,更是 多模态与语言模型融合的一次范式跃迁。
“We don’t just read documents—we compress them into vision.”
—— DeepSeek-OCR
延伸阅读:
- 论文地址:[arXiv 链接(待发布)]
- 代码开源:https://github.com/deepseek-ai/DeepSeek-OCR
- 相关工作:GOT-OCR2.0, Nougat, InternVL2, Qwen2-VL
更多推荐



所有评论(0)