一、ai agent开发和传统开发的区别

  1. 决策方式:
    • 传统:规则决策(条件判断、配置、枚举)
    • Agent:自然语言理解 + 推理决策,即状态驱动。它的本质是管理大模型随机性和用户意图模糊的双重不确定性。因此 Agent 不仅依靠架构编码实现骨架,更依赖持续评测、坏例迭代、约束对齐打磨上线能力。

二、开发步骤

1.造尺子

2.设计大脑

3.接手脚

4.关于bad case反哺评测体系

怎么确实bad case

  1. 用户显性反馈(最直接)
    用户主动表达不满:
    点「差评 / 不满意 / 回答错误」
    明确说:不对、错了、重新回答、你乱讲
    👉 这类 100% 直接标记为 Bad Case
  2. 系统规则自动识别(机器硬规则,最稳)
    不需要模型、不需要用户,代码直接判定:
    工具调用超限、死循环、重复调用
    输出为空、超长、乱码、格式错误
    流程卡死、不结束、一直追问
    敏感词、违规内容
    状态异常、任务卡住
    👉 这一类是纯代码自动抓 Bad Case
  3. 模型 / Agent 自检识别(自己查自己)
    反思模块 Self-Reflection
    挑刺 Critic 对抗评审

如何使用bad case

  • 原因:大模型有随机性、用户意图五花八门,永远写不全所有规则。只能通过:
    用户用 → 出问题(bad case)→ 抓下来 → 改提示词 / 加规则 / 调 RAG / 限制流程 → 下次不再错
    👉 靠真实失败案例,反向喂给系统,越用越稳

线上抓到的错误案例倒流(反哺)加到评测题库里进行测试,测试改好、测稳了,再上线。循环迭代这个过程。整个过程包含:「线上采错→离线优化→评测验收→灰度上线」

  • 错误案例的格式通常是JSON/结构化表格:
{
  "case_id": "bad_20260426_001",
  "error_type": "决策错误/幻觉/流程卡死/工具滥用/问诊不全",
  "user_query": "用户原始问题",
  "context_history": "完整上下文对话记录",
  "agent_raw_output": "Agent 当时错误回答",
  "expect_output": "标准正确答案/标准流程",
  "reason": "错误根因:prompt缺失、知识库不足、路由错误、状态bug",
  "create_time": "2026-04-26",
  "fix_status": "未修复/已优化/已回归通过"
}

在这里插入图片描述

三、和反思机制的区别:

  • 实时反思:单轮内即时纠错
    这一轮回答错了,当场自检、当场修正,属于实时闭环
  • Bad Case 反哺迭代:离线版本级优化
    把全网共性错误收集,改系统本身,属于长期进化闭环
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐