前言:为什么全自动 Agent 总在关键时刻崩?

大多数人搭多模态营销 Agent 的第一反应是:把所有环节塞进一个 Agent,让它从"输入一句话"一路跑到"自动发帖"。

结果通常是:跑通了演示 Demo,跑崩了线上账单。

本文想说的不是"你应该做全自动",而是:先把它做成"能产出、能止损、能复盘"的半自动流水线,反而能更快上线、更稳运行。


一、别把所有东西塞进一个 Agent:分清"脑子"和"工厂"

Agent 臃肿的根源,往往是没有分层。

一个健康的营销 Agent 架构,应该把职责拆成两个层:

🧠 脑子层(文本规划)

负责"想"的部分,交给你顺手的 LLM:

  • 推文结构设计
  • 产品卖点拆解
  • 风格蓝图输出(关键词、禁用词、画面描述、镜头节奏)

这一层的核心产物是一份结构化的 "发布包蓝图",它是后续所有媒体生成的输入。

🏭 工厂层(媒体生成)

负责"做"的部分,统一交给专门的媒体生成服务(如 crun.ai)去异步跑任务。

原因很现实:

  • 媒体侧你迟早要多模型对撞
  • 需要异步处理和失败重试
  • 需要用量对账和成本控制

如果自己对接多家媒体 API,你最终写的不是 Agent,而是一堆"修管道"的胶水代码。

核心原则:LLM 写脑洞,媒体服务出素材,各干各的,架构清晰,心态稳定。


二、先做"可交付"的最小闭环:不追求全自动,先追求可发布

与其设计一个完美的全自动系统,不如先跑通一个最小可交付闭环

我目前的最小闭环长这样:

Step 1: LLM 输出"发布包蓝图"
        ├── 标题 & 正文
        ├── 配图 / 视频 Prompt
        ├── CTA 文案
        └── 禁用项清单

Step 2: 媒体生成服务并发跑 2–3 个候选
        ├── 2 张候选图
        └── 1 段 6–8 秒短视频
        (别上来就并发 10 个,成本控制先行)

Step 3: 自动验收(土但有效)
        ├── 图片:尺寸 / 清晰度 / 是否有离谱元素
        └── 视频:时长 / 有无黑帧 / 有无明显崩脸崩字

Step 4: 人工点选"采用哪个"→ 发推 / 排程

这套流程"笨"在哪?它保留了一个人工决策节点。

但它的优点恰恰也在这里:你不需要相信 Agent 永远正确,你只需要它把素材做出来给你挑。 感知成本极低,上线门槛极低,可以今天就用。


三、把"烧钱点"提前卡住:止损规则写死,不给系统演戏空间

不写止损规则,真的会破产。以下三条我亲测有效:

止损规则具体实现目的
重试上限失败最多重试 2 次,超过直接 fail防止无限重试烧钱
对撞上限每个场景最多 3 个候选(视频尤其严格)控制并发成本
超时降级超过 45s 自动降级到更快模型 / 只出图不出视频避免单任务卡死整条链路

以伪代码表示降级逻辑:

async def generate_media(prompt, timeout=45):
    try:
        result = await asyncio.wait_for(
            run_video_generation(prompt), 
            timeout=timeout
        )
        return result
    except asyncio.TimeoutError:
        # 超时降级:换快模型或只出图
        return await run_image_fallback(prompt)
    except Exception as e:
        retry_count += 1
        if retry_count >= MAX_RETRIES:  # MAX_RETRIES = 2
            raise TaskFailed(f"超出重试上限: {e}")
        return await generate_media(prompt)

加了止损规则后,素材质量可能没有"玄学惊艳",但账单立刻变得像个正常人在花钱,Agent 也不再靠"努力重试"假装在工作。


四、素材要归档:不然两周后连复盘都没资格做

多模态任务有一个最容易被忽略的坑:生成的图片和视频不会永久存在。

很多平台的任务结果有过期机制,如果你不及时把素材下载落到自己的存储,过一阵子就"查无此物"。你连复盘"哪个模型更稳、哪个风格效果更好"都做不了。

所以我现在把归档当成流程的强制节点,缺一步不算闭环:

产出 → 验收 → 落盘归档 → 再发布

归档时建议记录的元数据:

{
  "task_id": "xxx",
  "created_at": "2025-06-01T10:00:00Z",
  "model": "stable-diffusion-xl",
  "prompt": "...",
  "result_url": "https://...",
  "local_path": "/archive/media/xxx.png",
  "status": "adopted",   // adopted / rejected / pending
  "scene": "summer_campaign_v2"
}

有了这些数据,你才能在两周后打开数据看板,知道哪个模型出图稳定率高,哪个风格的素材被采用率更高——这才是真正意义上的"闭环"。


总结

设计原则核心做法
分层架构LLM 负责规划,媒体服务负责生成,职责隔离
最小闭环保留人工点选节点,先追求可发布再追求全自动
止损规则重试上限 + 对撞上限 + 超时降级,三条缺一不可
素材归档产出即落盘,归档是闭环的一部分,不是可选项

全自动不是目标,稳定产出才是。 先跑通半自动流水线,跑稳了再一步步把人工节点自动化掉——这条路比一步到位靠谱得多。


如果你在搭类似的营销 Agent,欢迎在评论区交流踩过的坑。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐