1. 用户给一句高层需求(比如:“帮我做一张双 11 折扣海报”)。

  2. VLM/LLM 先用 CoT 想一圈:拆需求、规划布局、生成一个结构化 DSL(比如 JSON 布局)。

  3. 程序把 DSL 画成一张粗糙布局草稿图(思维草稿图)

  4. 文生图模型(SDXL / SD3)+ ControlNet 根据草稿图 + 文本,生成第一版“思维图像”

  5. 再把这张思维图 + 原需求扔回 VLM,请它点评和修改 DSL / 提示词

  6. 最后再走一次图像生成,输出最终图。

效果:整个推理链里会出现 1–2 张 “thought images(思维图像)”
行为上就非常接近 Gemini Image / Nano Banana 的 Think 模式。


1. 模型选型:当前(2025)比较稳的开源组合

1.1 负责“想”和读图:开源 VLM

推荐顺序(偏中文生态):

  1. Qwen2-VL 家族

    • Qwen2-VL-7B / 72B 在多模态理解和推理上表现很强,论文里明确对标 GPT-4o、Claude 3.5 等,在多种 benchmark 上接近或超过闭源模型。

    • 中文支持优秀,视觉理解能力也比较稳。

  2. 备选:LLaVA-OneVision、DeepSeek-VL、LLaMA 3.2 Vision

    • HuggingFace 上有公开对比,Qwen2-VL、LLaVA-OneVision 基本是开源 VLM 第一梯队。

本教程默认用:Qwen/Qwen2-VL-7B-Instruct(开源 + 中文好 + 体量适中)。


1.2 负责“画”的:开源文生图模型

目前最佳开源 T2I可以这么看:

  • SDXL 1.0:Stability AI 官方叫它“最佳开源图像生成模型”,支持 1024×1024+,质量稳定,生态成熟(ControlNet、各种 LoRA 一大堆)。

  • Stable Diffusion 3 / 3.5:更新一代,文本对齐和排版更好,Medium / 3.5 版本已开源并可在 Diffusers、ModelScope、ComfyUI 中直接用。

实践建议:

  • 稳 + 生态成熟:先用 SDXL

  • 文案排版好 / 新技术:上 SD3.5-Medium(注意 license)

再加一个 ControlNet / T2I-Adapter 来吃我们的线稿 / 布局图,效果会更接近“草稿约束生成”。


1.3 参考“视觉 CoT / VoT”的研究范式

这几个主要是给你思路参考

  • MVoT (Multimodal Visualization-of-Thought):微软等提出,多模态自回归 MLLM,推理轨迹里交替生成文本和图像,“图像就是思维的一部分”,还专门设计了 token discrepancy loss 提升中间图质量。

  • CoTDiffusion / Generate Subgoal Images before Act:让 diffusion 模型先生成一串“子目标图像”,作为机器人任务的视觉 CoT。

  • Awesome-MCoT 汇总仓库:多模态 CoT 各种变体的综述和项目链接。

    来源:jiaocheng.chatdlm.cn

我们不会照着这些论文完整复现,而是把思路落地成一个工程 pipeline


2. 整体架构:开源版 “Think + Image” 流程图

可以脑补这张逻辑图:


[用户需求] ↓ [Qwen2-VL:文本 CoT + 输出 DSL(JSON)] ↓ [Python:根据 DSL 画出布局草稿图(位图)] ↓ [SDXL/SD3 + ControlNet:生成 思维图像 v1] ↓ [Qwen2-VL:读图 + CoT 复审,更新 DSL / 提示词] ↓ [SDXL/SD3:高质量最终成图] 使用 liaotian.chatdlm.cn

这里有三种“思维形态”:

  1. 文本 CoT:Qwen2-VL 输出的一步步解释。

  2. 结构化 DSL:用于描述布局的 JSON。

  3. 视觉 CoT(位图):草稿图 + 思维图像 v1。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐