📚 论文信息

  • 标题CLIPPO: Image-and-Language Understanding from Pixels Only

  • 作者:Michael Tschannen, Basil Mustafa, Neil Houlsby

  • 单位:Google Research, Brain Team, Zürich

  • 会议:CVPR 2023

  • 🔗 代码与模型(Big Vision)


一、问题背景:多模态模型依然“割裂”

多模态模型(如 CLIP、ALIGN)在图像-语言理解上取得了重大突破。 但它们仍然存在一个关键问题: 👉 需要独立的图像编码器和文本编码器

这种结构带来了三大挑战:

  1. 📦 模型复杂度高:不同模态需独立塔结构(towers)与预处理流程;

  2. 🧱 工程割裂:训练和迁移流程依赖模态特定优化;

  3. 🌍 语言限制:仍依赖词表与 tokenizer,难以支持多语言。

于是问题来了—— 能否构建一个统一的模型, 既能理解图像,又能“看懂”文字,而无需任何词表?


二、核心方法:一个像素通吃的多模态模型 CLIPPO

论文提出的 CLIPPO(CLIP - Pixels Only), 在理念上是 CLIP 的进一步统一化:

不再用两个编码器,而是一个纯视觉 Transformer 来处理一切。

✳️ 模型思路

  • 输入统一为图像: 无论是真实图片还是文本,统统渲染成 RGB 图像;

  • 单一 Vision Transformer 编码器: 使用同一参数处理图像和渲染文本;

  • 对比学习训练: 采用 CLIP 风格的 contrastive loss 学习跨模态对齐;

  • 无词表、无 tokenizer: 所有语言、符号都能被统一地视觉建模。

简单来说:

CLIPPO 用一个视觉模型“看懂”文字与图片, 消除了语言和视觉之间的人为边界。


三、实验验证:轻量统一,性能接近 CLIP

研究团队基于 ViT-B/16 与 ViT-L/16 架构, 在大规模 WebLI 数据(109 种语言的 10 亿图像-文本对)上训练模型, 并与 CLIP 及单塔(1T-CLIP)模型进行对比。

🔹1. 图像与跨模态任务

  • CLIPPO 仅用单一编码器,参数量约为 CLIP 的一半;

  • 在 ImageNet 分类与图文检索上性能仅下降约 2%;

  • CLIPPO-L/16 在 COCO、Flickr30k 检索上接近 CLIP;

  • 多语言检索任务中,CLIPPO 略优于传统 tokenizer 模型。

🔹2. 语言理解任务(GLUE)

  • 单用 WebLI 预训练,CLIPPO 超越 ELMo+BiLSTM 与早期对比模型;

  • 增加 C4 语料句对对比训练(Next Sentence Contrastive) 后, GLUE 平均分提升至 78.4,接近 BERT-Base;

  • 同时仍保持较好的视觉任务性能。

🔹3. 视觉问答(VQAv2)

  • 仅通过“将问题文字渲染在图像上方”实现问答;

  • 得分超过 CLIP 与 1T-CLIP, 与 ViLT、METER 等专用多模态模型相当。


四、主要优势与局限

✅ 优势

  • 彻底去词表化:支持任意语言脚本;

  • 统一架构:单一模型处理图像、文本及多模态任务;

  • 参数效率高:约为 CLIP 的一半;

  • 强多语言能力:无需 tokenizer 即具备跨语种检索性能。

⚠️ 局限

  • 语言理解仍需辅以文本对比训练;

  • 模型在语法判断任务(如 CoLA)表现较弱;

  • 仍为编码器结构,不具备生成能力;

  • 对真实世界复杂文本(如文档OCR)泛化有限。


五、研究意义与展望

CLIPPO 的意义在于,它展示了一种新的多模态统一思路:

  • 不再从“词”理解语言,而是从“视觉”理解符号;

  • 在不依赖词表的情况下实现多语言、多模态学习;

  • 为统一处理图像、文本、语音甚至视频提供基础。


📝 一句话总结: CLIPPO 让模型通过“看”来理解语言, 用统一的视觉方式,打通了多模态与多语言的界限。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐