一、问题背景:语言模型还不会真正看懂文字

虽然多模态语言模型(如 GPT-4V、Gemini)能同时处理图像与文本,但当输入是包含文字的图像(如截图、网页、UI)时,它们往往理解不准确。

现有方案大致分为两类:

  1. OCR 管线式模型 —— 先识别文字再理解,误差传递明显;

  2. 多塔结构模型(dual encoders) —— 图像与文本分别编码,空间信息丢失严重。

近年来兴起的 Screenshot Language Models(截图语言模型)(如 PIXEL、Pix2Struct)尝试直接从像素理解文字,不依赖 OCR。 但问题在于:这些模型语言理解能力弱,在 GLUE 等标准语言任务上比 BERT 仍低 6~8 个百分点。

如何让截图语言模型也能像 BERT 一样真正理解语言? 这正是本文的核心目标。

二、方法创新:Patch-and-Text Prediction(PTP)

论文提出了一种新的训练目标 PTP(Patch-and-Text Prediction), 通过同时预测图像块和文字,让模型在视觉与语言上双向增强。

🔹 核心思想

用像素输入学习文字结构,用语言预测学习语义内容。

🔹 实现方式

  1. 文本渲染:将纯文本渲染成“截图”,输入模型;

  2. Patch Masking:随机遮盖部分图像块,让模型重建被遮挡像素;

  3. Text Masking:随机遮盖部分文字 token,让模型恢复语义内容;

  4. 双预测目标

  • 图像预测(视觉层面)

  • 文字预测(语言层面)

这种联合训练方式让模型既“看清文字”,又能“读懂语言”。 相比纯视觉自编码(如 PIXEL)或纯语言 MLM(如 BERT),PTP 在架构上更均衡。


三、实验结果:截图模型也能理解语言

研究者在 GLUE 八项语言理解任务 上评测了 PTP,与多个代表模型对比:

模型

参数规模

目标类型

GLUE 平均分

BERT-base

110M

语言MLM

83.0

PIXEL

86M

Patch预测

76.0

CLIPPO

93M

无词表CLIP

74.0

PTP(本文)

86M

Patch+Text预测

80.2

结果显示:

  • PTP 比 PIXEL 平均提升 +4.2%,单项任务最高 +8%;

  • 在 6/8 个任务上,PTP 的表现已接近 BERT;

  • 说明模型即使只看像素截图,也能有效理解语言语义。

此外,作者还在自回归(生成式)框架中验证了该方法。 PTP 在相同上下文长度下将困惑度(Perplexity)从 10.28 降至 9.66,证明其可扩展至语言生成任务。


📝 一句话总结

PTP 让语言模型学会“看文字、懂语义”, 是连接视觉与语言理解的关键一步,也让 Screenshot LM 真正具备语言智能。


Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐