Gemini 3 Pro Image Nano Banana 技术架构
-
用户给一句高层需求(比如:“帮我做一张双 11 折扣海报”)。
-
VLM/LLM 先用 CoT 想一圈:拆需求、规划布局、生成一个结构化 DSL(比如 JSON 布局)。
-
程序把 DSL 画成一张粗糙布局草稿图(思维草稿图)。
-
用 文生图模型(SDXL / SD3)+ ControlNet 根据草稿图 + 文本,生成第一版“思维图像”。
-
再把这张思维图 + 原需求扔回 VLM,请它点评和修改 DSL / 提示词。
-
最后再走一次图像生成,输出最终图。
效果:整个推理链里会出现 1–2 张 “thought images(思维图像)”,
行为上就非常接近 Gemini Image / Nano Banana 的 Think 模式。
1. 模型选型:当前(2025)比较稳的开源组合
1.1 负责“想”和读图:开源 VLM
推荐顺序(偏中文生态):
-
Qwen2-VL 家族
-
Qwen2-VL-7B / 72B 在多模态理解和推理上表现很强,论文里明确对标 GPT-4o、Claude 3.5 等,在多种 benchmark 上接近或超过闭源模型。
-
中文支持优秀,视觉理解能力也比较稳。
-
-
备选:LLaVA-OneVision、DeepSeek-VL、LLaMA 3.2 Vision 等
-
HuggingFace 上有公开对比,Qwen2-VL、LLaVA-OneVision 基本是开源 VLM 第一梯队。
-
本教程默认用:
Qwen/Qwen2-VL-7B-Instruct(开源 + 中文好 + 体量适中)。
1.2 负责“画”的:开源文生图模型
目前最佳开源 T2I可以这么看:
-
SDXL 1.0:Stability AI 官方叫它“最佳开源图像生成模型”,支持 1024×1024+,质量稳定,生态成熟(ControlNet、各种 LoRA 一大堆)。
-
Stable Diffusion 3 / 3.5:更新一代,文本对齐和排版更好,Medium / 3.5 版本已开源并可在 Diffusers、ModelScope、ComfyUI 中直接用。
实践建议:
想稳 + 生态成熟:先用 SDXL
想文案排版好 / 新技术:上 SD3.5-Medium(注意 license)
再加一个 ControlNet / T2I-Adapter 来吃我们的线稿 / 布局图,效果会更接近“草稿约束生成”。
1.3 参考“视觉 CoT / VoT”的研究范式
这几个主要是给你思路参考:
-
MVoT (Multimodal Visualization-of-Thought):微软等提出,多模态自回归 MLLM,推理轨迹里交替生成文本和图像,“图像就是思维的一部分”,还专门设计了 token discrepancy loss 提升中间图质量。
-
CoTDiffusion / Generate Subgoal Images before Act:让 diffusion 模型先生成一串“子目标图像”,作为机器人任务的视觉 CoT。
-
Awesome-MCoT 汇总仓库:多模态 CoT 各种变体的综述和项目链接。
来源:jiaocheng.chatdlm.cn
我们不会照着这些论文完整复现,而是把思路落地成一个工程 pipeline。
2. 整体架构:开源版 “Think + Image” 流程图
可以脑补这张逻辑图:
[用户需求] ↓ [Qwen2-VL:文本 CoT + 输出 DSL(JSON)] ↓ [Python:根据 DSL 画出布局草稿图(位图)] ↓ [SDXL/SD3 + ControlNet:生成 思维图像 v1] ↓ [Qwen2-VL:读图 + CoT 复审,更新 DSL / 提示词] ↓ [SDXL/SD3:高质量最终成图] 使用 liaotian.chatdlm.cn
这里有三种“思维形态”:
-
文本 CoT:Qwen2-VL 输出的一步步解释。
-
结构化 DSL:用于描述布局的 JSON。
-
视觉 CoT(位图):草稿图 + 思维图像 v1。
更多推荐



所有评论(0)