🌍 引言:从文本洪流到视觉压缩的旅程

当前的大型语言模型(LLMs)在处理长文本时面临巨大计算挑战,其复杂度随着序列长度的平方级增长而激增。想象一下,你试图在一张巨大的拼图上找到所有碎片,但每多一块,难度就翻倍!为了解决这一难题,我们提出了一种新颖的思路:利用视觉模态作为高效的压缩媒介。毕竟,一张包含文档文本的图片可以用远少于等效数字文本的标记(token)来承载丰富信息,这就像用一幅画代替千言万语。基于此洞见,我们从LLM的视角重新审视视觉语言模型(VLMs),聚焦于如何通过视觉编码器提升文本处理效率,而非仅停留在人类擅长的视觉问答(VQA)任务上。

DeepSeek-OCR由此诞生,作为一种初步概念验证,探索视觉-文本压缩的可行性。这一模型的核心在于将光学2D映射技术应用于长上下文压缩,旨在为历史长上下文压缩和LLM的记忆遗忘机制研究提供新方向。它的设计不仅展示了理论上的突破,还在实际应用中展现了显著潜力。例如,在OmniDocBench测试中,DeepSeek-OCR仅使用100个视觉标记就超越了GOT-OCR2.0(256标记/页),并在少于800个视觉标记的情况下优于MinerU2.0(平均6000+标记/页)。更令人振奋的是,它每天可为LLMs/VLMs生成超过200,000页训练数据(单A100-40G卡)!代码和模型权重已在http://github.com/deepseek-ai/DeepSeek-OCR公开,欢迎探索。

🧩 技术内核:DeepEncoder的独特设计

DeepSeek-OCR由两个主要组件组成:DeepEncoder(编码器)和DeepSeek3B-MoE-A570M(解码器)。DeepEncoder是整个系统的核心引擎,旨在在高分辨率输入下保持低激活,同时实现高压缩比,确保视觉标记数量可控且高效。它的设计灵感来源于自然界的“简约美”:通过串联窗口注意力和全局注意力机制,再辅以16倍卷积压缩器,将复杂的视觉信息浓缩为精华。

具体来说,DeepEncoder包含三个关键部分:

  • 窗口注意力:基于SAM-base(80M参数),负责局部特征提取,处理大量视觉标记时激活内存仍保持可控。
  • 全局注意力:利用CLIP-large(300M参数),提供全局知识表示,增强模型对整体内容的理解。
  • 16倍压缩器:通过两层卷积(核大小3,步幅2,填充1,通道从256增至1024),将4096个初始标记压缩至256个,显著降低内存需求。

实验结果令人振奋:在Fox基准测试中,当文本标记数量不超过视觉标记的10倍(压缩比<10×)时,OCR解码精度高达97%;即使压缩比达到20×,精度仍维持在约60%。这表明,DeepSeek-OCR不仅在理论上可行,还为实际部署提供了坚实基础。

📊 性能巅峰:超越同行的卓越表现

在OmniDocBench上,DeepSeek-OCR以最少的视觉标记实现了业界领先的性能。图1(b)展示了其与InternVL2-76B、Qwen2.5-VL-72B等模型的对比:DeepSeek-OCR(Gundam-M 200dpi)在编辑距离(Edit Distance)上表现优异,仅需1500个以下的视觉标记就胜过使用更多标记的竞争对手。想象一下,这就像用一小块巧克力做出了比整块蛋糕还美味的甜点!

此外,DeepSeek-OCR支持多种分辨率模式(Tiny、Small、Base、Large、Gundam等),通过动态插值和填充技术,适应不同输入需求。例如,Gundam模式通过2-9个640×640局部视图加1024×1024全局视图,处理超高分辨率图像(如报纸扫描件),激活内存进一步优化。这种灵活性让模型在研究和生产中都能游刃有余。

🎭 趣味扩展:从数据到应用的科学故事

为了训练DeepSeek-OCR,我们构建了多样化的数据引擎,包括OCR 1.0(传统场景和文档OCR)、OCR 2.0(解析图表、化学公式等复杂图像)以及通用视觉数据。这些数据涵盖30M页PDF,涉及100多种语言,其中中文和英语占比约25M页。数据标注分为粗略和精细两种,确保模型既能捕捉大意,又能处理细节。

有趣的是,DeepSeek-OCR还能解析图表和化学公式!例如,一张包含方程的图像可以被转化为Markdown格式的描述(如$E=mc^2$),并辅以注解解释其物理意义(> 爱因斯坦的质能方程表明质量和能量可以相互转化,这是相对论的基础,适用于核反应等场景)。这种能力让模型不仅限于文本,还能服务于跨学科研究。

🔮 展望与启发

DeepSeek-OCR的成功表明,视觉模态作为文本压缩媒介的前景广阔。它的7-20倍标记减少能力,为解决LLM长上下文挑战提供了新思路。未来,通过优化预训练设计,larger LLMs或许能更自然地集成这一技术,开启文本处理效率的新篇章。想象一下,你站在一个巨大的图书馆前,DeepSeek-OCR像魔术师一样,将成堆的书本压缩成几页精华供你阅读,这不正是科技的魅力吗?

📚 参考文献
  1. Wei, H., Sun, Y., Li, Y. (2025). DeepSeek-OCR: Contexts Optical Compression. DeepSeek-AI.
  2. Fox Benchmark [21].
  3. OmniDocBench [27].
  4. DeepSeekMoE [19, 20].
  5. SAM-base [17], CLIP-large [29].

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐