deepseek-ocr 多模态OCR模型论文速读:将文档文本转换为图像,用更少的视觉token表示丰富的信息
第一章 引言
-
论文介绍了当前大语言模型(LLMs)在处理长文本内容时面临的计算挑战,主要由于序列长度的二次方扩展导致。
-
作者提出了一种潜在的解决方案:利用视觉模态作为文本信息的高效压缩媒介。通过将文档文本转换为图像,可以用更少的视觉token表示丰富的信息,实现更高的压缩比。
-
OCR任务作为视觉和语言之间的中间模态,为这种视觉-文本压缩范式提供了理想的测试平台,因为它在视觉和文本表示之间建立了自然的压缩-解压缩映射,并提供了定量评估指标。
第二章 相关工作
-
典型VLM中的视觉编码器:当前开源的VLM主要采用三种类型的视觉编码器,包括双塔架构、基于切片的方法和自适应分辨率编码。这些方法在处理高分辨率图像时存在各自的缺陷,如激活内存过高、视觉token过多或部署困难。
-
端到端OCR模型:随着VLM的发展,许多端到端OCR模型涌现,简化了传统OCR系统(需要独立的检测和识别专家模型)的架构。然而,当前模型尚未解决一个关键的研究问题:对于包含1000个单词的文档,解码至少需要多少视觉token。
第三章 方法论
-
架构:DeepSeek-OCR采用统一的端到端VLM架构,包括DeepEncoder编码器和DeepSeek3B-MoE解码器。编码器负责提取图像特征、token化以及压缩视觉表示,解码器基于图像token和提示生成所需结果。
-
DeepEncoder:为探索上下文光学压缩的可行性,作者设计了DeepEncoder,它具有处理高分辨率、高分辨率下低激活、视觉token少、支持多分辨率输入和参数数量适中等特点。DeepEncoder主要由窗口注意力主导的局部感知特征提取分量和具有密集全局注意力的视觉知识特征提取分量组成,并通过16×卷积压缩器连接。
-
多分辨率支持:DeepEncoder通过动态插值位置编码支持多种分辨率模式,包括原生分辨率模式(Tiny、Small、Base、Large)和动态分辨率模式(Gundam模式),以适应不同的压缩比需求和应用场景。
-
MoE解码器:使用DeepSeekMoE架构,具体为DeepSeek-3B-MoE,在推理时激活6个路由专家和2个共享专家,共约570M激活参数,适合领域中心的VLM研究。
-
数据引擎:构建了复杂多样的训练数据,包括OCR 1.0数据(传统OCR任务)、OCR 2.0数据(复杂人工图像解析任务)、通用视觉数据和纯文本数据,以确保模型的多任务能力和语言理解能力。
-
训练流程:训练分为两个阶段,首先独立训练DeepEncoder,然后训练完整的DeepSeek-OCR模型。训练过程中采用了管道并行和数据并行策略,并在HAI-LLM平台上进行。
第四章 评估
-
视觉-文本压缩研究:使用Fox基准测试集评估DeepSeek-OCR的压缩-解压缩能力,结果表明在10×压缩比下,模型的解码精度可达约97%,20×压缩比下仍保持约60%的精度,显示出视觉上下文压缩是一个有前景的研究方向。
-
OCR实际性能:在OmniDocBench上的测试结果显示,DeepSeek-OCR在实际应用中表现出色,使用较少的视觉token即可达到与其他先进模型相当的性能,证明了其在实际应用中的强大能力和高研究天花板。
-
定性研究:DeepSeek-OCR具备深度解析能力,能够对文档中的图表、几何图形、化学公式和自然图像进行进一步的解析。此外,模型还支持近100种语言的多语言识别,并保留了一定的通用视觉理解能力。
第五章 讨论
- 作者将视觉-文本压缩视为模拟人类记忆遗忘机制的一种方式,通过将历史文本渲染到图像中进行初步压缩,然后逐渐缩小旧图像以实现多级压缩,从而实现文本的遗忘。这种方法为实现理论上无限上下文架构提供了可能,平衡了信息保留与计算约束之间的关系。
第六章 结论
- 论文提出了DeepSeek-OCR模型,并初步验证了上下文光学压缩的可行性,表明模型能够从少量视觉token中有效解码出超过10倍数量的文本token。这一发现将为未来VLM和LLM的发展提供促进,并为长上下文挑战提供有前景的新方向。
核心技术汇总表

更多推荐




所有评论(0)