导读:DeepSeek-OCR 提出的光学 2D 映射方法宣称能实现 10 倍的视觉-文本压缩,看似解决了 LLM 的长文本痛点。但这种惊人的效果究竟源自模型“看懂”了图像,还是仅仅依靠强大的语言模型在“脑补”?

来自中科院成都计算所、深圳先进院、深圳理工大学以及日本东北大学的AI团队的论文:"Visual Merit or Linguistic Crutch? A Close Look at DeepSeek-OCR" 深入剖析了这一问题,并揭示了一个令人惊讶的结论:去掉语言先验,DeepSeek-OCR 的准确率从 90% 暴跌至 20%。

  • 论文 Arxiv 链接: https://arxiv.org/abs/2601.03714

  • 项目代码: https://github.com/dududuck00/DeepSeekOCR

引言:完美的错觉

长文本处理一直是基于Transform架构的LLMs的瓶颈。DeepSeek-OCR 通过将文本编码为密集的视觉 Token,声称仅用 64-400 个视觉 Token 就能重建单页文本,在 10 倍压缩率下达到 97% 的精度。 这听起来像是通往无限上下文的“银弹”。然而,我们不禁要问:这究竟是视觉理解的胜利,还是语言概率的把戏? 为了验证这一点,我们设计了一套“语义破坏(Semantic Disruption)”实验,剥离模型的语言外挂,还原其真实的视觉能力。

实验一:当“蝴蝶”变成“面包”

我们首先进行了句子级语义破坏。我们将原文中合理的通顺的符合语言先验的词汇替换为拼写相似但语义荒谬的词以去除语言先验的影响。例如,将 ”butterfly” 替换为 “breadflutter”。

结果令人咋舌: DeepSeek-OCR 在面对这些荒谬但视觉清晰的文本时,并没有忠实地记录图像,而是试图利用上下文“纠正”它们。如图1所示,它把图片上明明白白的 “Squeaker” 强行识别成了 “Square”,把不存在的词 “rebound” 强行脑补成了 “rebroadcast” 。这证明,在视觉 Token 被高度压缩时,Decoder 并不是在“看”字,而是在利用解码器语言模型的语言先验(Priors)进行“猜”字 。

图1:语义破坏实验示例

实验二:撕下“语言先验”后的真相

为了彻底量化这种依赖,我们进行了更极端的测试:无先验随机文本(Zero-Prior Random Text)。我们生成了完全没有语义、词法结构的随机字符图像,以此作为 OCR 系统的“吐真剂” 。 结果显示,DeepSeek-OCR 的准确率从原本的 90% 直线下降到 20% 以下(见图2)。这表明,在没有语言先验的情况下,DeepSeek-OCR 几乎无法正确识别文本,彻底暴露了其对语言模型的过度依赖。

此外,我们还在其他的端到端 OCR 模型 和 VLM模型 上进行了同样的无先验随机文本测试。结果显示,这些模型同样表现不佳,准确率下降幅度约40-60%不等,进一步验证了语言先验在视觉文本识别中的重要作用。 相比之下,传统的 Pipeline OCR 方法(如 PaddleOCR)展现出了极高的鲁棒性,仅有4.9%的准确率下降,凸显了其视觉识别能力的独立性 。

结论:DeepSeek-OCR 的高分表现,很大程度上是建立在“语言先验”之上的幻觉,而非纯粹的视觉识别能力,并且这种现象在其他的端到端模型中也普遍存在。

图2:无先验随机文本实验结果
对比其他模型在随机文本上的表现
对比其他模型在随机文本上的表现

实验三:既看不准,也想不通?

如果只是 OCR 识别出错也就罢了,这种机制对下游任务有影响吗?我们在 Visual Question Answering (VQA) 和 Text Question Answering (QA) 任务上进行了测试。

结果显示了完全的“推理崩塌”:尽管 OCR 表面精度很高,但在涉及逻辑推理的QA任务中,DeepSeek-OCR 的正确率只有27.7%,而同等参数大小的语言模型正确率都在90%以上(见图3); 在VQA任务中,准确率更是仅为 20% 左右,接近随机猜测,这说明光学压缩过程破坏了支持逻辑推理所需的深层语义结构。

VQA 和 QA 任务结果
VQA 和 QA 任务结果

这说明光学压缩过程破坏了支持逻辑推理所需的深层语义结构 。

实验四:长文本的“隐形墙”

DeepSeek-OCR 的初衷是解决长文本问题。然而,我们的压力测试发现了另一个悖论。

随着输入长度增加,无论使用哪种分辨率模式(Tiny/Small/Base/Large),模型都在 8,500 到 10,500 Token 左右经历了彻底的性能崩溃(Model Collapse) 。

这意味着,当前的光学压缩技术不仅没有解决长文本瓶颈,反而引入了一个更严格的信息论瓶颈——固定网格的编码器无法承载无限的信息密度。

长文本压力测试结果
长文本压力测试结果

总结与展望

我们的研究表明:Visual Merit or Linguistic Crutch? 答案倾向于后者。

DeepSeek-OCR 所展示的高压缩率和高精度,更多地依赖于强大的语言模型来“填补”视觉信息的缺失,而非真正的视觉理解能力。

这为这一范式的未来发展敲响了警钟:要实现真正有效的长文本处理,需要进一步提升视觉编码的表达能力,减少对语言先验的依赖而造成的信息丢失与幻觉。

我们希望这项工作能激发社区对视觉-语言模型中视觉理解与语言先验关系的深入思考,推动更健壮、更可靠的长文本处理技术的发展。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐