企业 Agent 接进真实流程前,先过 6 道验收闸门

很多团队讨论企业 AI Agent 时,问题会很快落到模型、工具和成本。

这些都重要,但如果 Agent 准备接进真实工单、订单、设备或资金流,真正该先问的不是“它会不会做”,而是“我们准备让它在什么条件下做”。

也就是说,生产落地前要先过验收闸门。

我这里说的验收,不是最后做一轮 UI 测试,而是把 Agent 进入业务流程前必须满足的控制条件,提前写清楚。没有这些闸门,系统往往能演示,却不适合上线。

下面这 6 道闸门,是我更建议先补齐的。

1. 目标流程要收窄,不能用“全场景智能助手”开局

很多项目一开始就希望 Agent 同时覆盖问答、检索、工单、审批、通知、报表和执行动作。

这类范围通常太散,最后连失败标准都定义不出来。

更稳妥的做法是先把目标流程收窄成一个明确场景:

  • 谁发起请求;
  • Agent 读取哪些数据;
  • Agent 最多做到哪一步;
  • 哪些动作仍然停在草稿;
  • 最终由谁验收结果。

例如,先做“工单初筛并生成处理建议”,通常就比“自动完成整个售后流程”更适合第一阶段。因为前者的边界、责任人和复盘口径都更清楚。

2. 证据要先齐,再允许模型做判断

不少 Agent 流程最大的问题,不是模型推理差,而是它在证据不完整时也继续往下走。

如果订单状态没取全、客户等级没查到、设备最新心跳没返回、知识库命中率不足,系统就不该假装自己已经“理解了上下文”。

更合理的做法是把判断前置条件写成显式门槛:

  • 关键字段是否齐全;
  • 数据是否在有效时间窗内;
  • 是否命中可信知识源;
  • 是否存在互相冲突的证据;
  • 证据不足时是重试、降级还是转人工。

这一步的目标不是让模型更聪明,而是避免它在证据不足时继续硬做。

3. 工具权限要按读、写、外发分级

真实业务里,很多风险不是来自“用错模型”,而是来自 Agent 获得了超出成熟度的执行权限。

我更建议把工具权限至少分成三层:

  • 只读:查询状态、检索资料、读取日志、拉取报表;
  • 可写:创建内部任务、更新低风险字段、生成内部草稿;
  • 外发或高风险写入:发客户消息、改订单状态、触发付款、下发设备指令。

同一个 Agent 能读,不代表也应该能写;能写内部草稿,不代表也能对外执行。

只有把权限拆开,后面的人工确认、回滚和审计才有落点。

4. 高风险动作必须明确人机分界

很多团队担心人工确认会影响效率,所以会尽量把确认点拿掉。

但在生产 Agent 里,人工确认不是低效设计,而是风险隔离层。

下面这些动作,一般都不适合默认自动执行:

  • 涉及资金、额度、退款、审批;
  • 改变客户可见状态;
  • 发送正式对外消息;
  • 修改权限、白名单或合规记录;
  • 影响现场设备状态或控制指令。

一个可行的设计不是“全部人工”,而是按风险分流:

  1. 低风险动作自动执行;
  2. 中风险动作生成草稿并展示证据;
  3. 高风险动作提交人工确认,不直接放行。

这样做的价值,是让团队知道自动化到底推进到了哪一步,而不是把所有责任一起交给模型。

5. 失败路径和回滚路径要先写,不要只写成功路径

很多流程图只画 happy path:查到数据、模型判断、调用工具、返回结果。

但生产成熟度更看这些分支:

  • 下游接口超时怎么办;
  • 工具只返回部分数据怎么办;
  • 外部系统报 429 或 500 怎么办;
  • 写入做了一半怎么办;
  • 人工确认超时怎么办;
  • 模型判断和业务规则冲突时以谁为准。

如果这些路径没有前置定义,系统会在不确定状态下继续推进,最后把一个可恢复错误做成业务事故。

所以“能不能回滚、谁来接管、恢复到哪个状态”,应该和主流程一起设计,而不是等出事后再补。

6. 验收指标要对业务负责,不要只看模型回答像不像

很多 Agent 试点最后验收只看两件事:回答看起来顺不顺,领导演示时能不能跑通。

这个口径太弱。

更接近生产的验收,至少要覆盖:

  • 成功完成率;
  • 人工接管率;
  • 高风险动作拦截率;
  • 错误恢复时间;
  • 审计链完整率;
  • 对业务方真正节省的处理时间。

如果一条流程没有这些指标,团队很难判断它到底是在创造可持续效率,还是只是多了一个需要盯着看的入口。

一个更实用的最小上线标准

如果团队已经准备把 Agent 接进真实流程,我更建议先问下面 6 个问题:

  1. 目标流程是否收窄到一个明确场景;
  2. 判断前证据是否有显式门槛;
  3. 工具权限是否完成读写外发分级;
  4. 高风险动作是否有人机分界;
  5. 失败和回滚路径是否先设计;
  6. 验收指标是否对业务结果负责。

这 6 项都能答清楚,很多“Agent 还不敢上线”的问题会从抽象焦虑,变成具体的工程和治理任务。

这也是为什么我通常不把生产 Agent 讨论成一个 prompt 或模型选择问题。真正决定能不能上线的,往往是这些控制条件有没有补齐。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐