【DeepSeek-OCR系列第四篇】PTP:让语言模型真正“读懂截图”的训练方法【arXiv24】
一、问题背景:语言模型还不会真正看懂文字
虽然多模态语言模型(如 GPT-4V、Gemini)能同时处理图像与文本,但当输入是包含文字的图像(如截图、网页、UI)时,它们往往理解不准确。
现有方案大致分为两类:
-
OCR 管线式模型 —— 先识别文字再理解,误差传递明显;
-
多塔结构模型(dual encoders) —— 图像与文本分别编码,空间信息丢失严重。
近年来兴起的 Screenshot Language Models(截图语言模型)(如 PIXEL、Pix2Struct)尝试直接从像素理解文字,不依赖 OCR。 但问题在于:这些模型语言理解能力弱,在 GLUE 等标准语言任务上比 BERT 仍低 6~8 个百分点。
如何让截图语言模型也能像 BERT 一样真正理解语言? 这正是本文的核心目标。
二、方法创新:Patch-and-Text Prediction(PTP)
论文提出了一种新的训练目标 PTP(Patch-and-Text Prediction), 通过同时预测图像块和文字,让模型在视觉与语言上双向增强。
🔹 核心思想
用像素输入学习文字结构,用语言预测学习语义内容。
🔹 实现方式
-
文本渲染:将纯文本渲染成“截图”,输入模型;
-
Patch Masking:随机遮盖部分图像块,让模型重建被遮挡像素;
-
Text Masking:随机遮盖部分文字 token,让模型恢复语义内容;
-
双预测目标:
-
图像预测(视觉层面)
-
文字预测(语言层面)
这种联合训练方式让模型既“看清文字”,又能“读懂语言”。 相比纯视觉自编码(如 PIXEL)或纯语言 MLM(如 BERT),PTP 在架构上更均衡。
三、实验结果:截图模型也能理解语言
研究者在 GLUE 八项语言理解任务 上评测了 PTP,与多个代表模型对比:
|
模型 |
参数规模 |
目标类型 |
GLUE 平均分 |
|---|---|---|---|
|
BERT-base |
110M |
语言MLM |
83.0 |
|
PIXEL |
86M |
Patch预测 |
76.0 |
|
CLIPPO |
93M |
无词表CLIP |
74.0 |
| PTP(本文) |
86M |
Patch+Text预测 |
80.2 |
结果显示:
-
PTP 比 PIXEL 平均提升 +4.2%,单项任务最高 +8%;
-
在 6/8 个任务上,PTP 的表现已接近 BERT;
-
说明模型即使只看像素截图,也能有效理解语言语义。
此外,作者还在自回归(生成式)框架中验证了该方法。 PTP 在相同上下文长度下将困惑度(Perplexity)从 10.28 降至 9.66,证明其可扩展至语言生成任务。
📝 一句话总结
PTP 让语言模型学会“看文字、懂语义”, 是连接视觉与语言理解的关键一步,也让 Screenshot LM 真正具备语言智能。
更多推荐



所有评论(0)