在这里插入图片描述

📖标题:Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning
🌐来源:arXiv, 2507.16746

🌟摘要

在解决复杂问题时,人类经常使用视觉辅助工具,例如图表或草图。训练多模态模型做同样的事情,称为思想链(Visual CoT),具有挑战性:(1)现成的视觉CoT性能较差,阻碍了强化学习;(2)缺乏高质量的视觉CoT训练数据。我们介绍了 Zebra-CoT,这是一个多样化的大规模数据集,包含 182,384 个样本,包含逻辑上连贯的交错文本图像推理轨迹。我们专注于四类任务,其中草图或视觉推理特别自然,跨越几何、物理和算法等科学问题; 2D 视觉推理任务,如视觉搜索和拼图; 3D 推理任务,包括 3D 多跳推理、体现和机器人规划;视觉逻辑问题和国际象棋等战略游戏。在 Zebra-CoT 训练语料库上微调 Anole - 7B 模型会导致我们的测试集准确度提高 +12%,并在标准 VLM 基准评估上产生高达 +13% 的性能提升。微调 Bagel-7B 产生了一个生成高质量的交错视觉推理链的模型,强调了 Zebra-CoT 在开发多模态推理能力方面的有效性。我们开源了我们的数据集和模型来支持视觉 CoT 的开发和评估。

🛎️文章简介

🔸研究问题:如何构建一个高质量的多模态数据集,以支持视觉与语言推理模型的训练?
🔸主要贡献:论文提出并发布了ZEBRA-COT数据集,包含182384个交错的文本和图像推理实例,有助于提高视觉推理模型的性能。

📝重点思路

🔸通过从真实世界领域收集和清洗原始推理数据,结合使用模板化推理和视觉语言模型(VLM),创建一个大规模多模态数据集。
🔸数据集涵盖科学推理、2D视觉推理、3D视觉推理和视觉逻辑与战略游戏等多个类别和子类别。
🔸通过对Anole-7B和BAGEL-7B模型进行微调,评估数据集对模型推理能力的提升。
🔸针对现有数据集的局限性,提出了一种新的方法来提升文本和图像之间的逻辑一致性,确保数据集用于模型训练时有明确的逻辑结构。

🔎分析总结

🔸在对Anole-7B模型进行微调后,准确率从4.2%提高到16.9%,相对性能提升了4倍,并在视觉推理基准测试中平均提升4.9%。
🔸BAGEL-7B微调后,模型可以在解决问题的过程中,自然生成高质量的视觉推理链(visual CoT),表明其在多模态推理能力方面的提升。
🔸数据集内的推理轨迹表现出更广泛的推理能力,特别是在视觉逻辑和战略游戏方面,有助于开启未来强化学习的训练方向。

💡个人观点

论文的创新点在于提出了一个广泛和逻辑一致的多模态推理数据集,能够有效支持视觉与语言模型在逻辑上的训练。

🧩附录

在这里插入图片描述

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐