Ai agent的开发核心逻辑
·
文章目录
一、ai agent开发和传统开发的区别
- 决策方式:
- 传统:规则决策(条件判断、配置、枚举)
- Agent:自然语言理解 + 推理决策,即状态驱动。它的本质是管理大模型随机性和用户意图模糊的双重不确定性。因此 Agent 不仅依靠架构编码实现骨架,更依赖持续评测、坏例迭代、约束对齐打磨上线能力。
二、开发步骤
1.造尺子
2.设计大脑
3.接手脚
4.关于bad case反哺评测体系
怎么确实bad case
- 用户显性反馈(最直接)
用户主动表达不满:
点「差评 / 不满意 / 回答错误」
明确说:不对、错了、重新回答、你乱讲
👉 这类 100% 直接标记为 Bad Case - 系统规则自动识别(机器硬规则,最稳)
不需要模型、不需要用户,代码直接判定:
工具调用超限、死循环、重复调用
输出为空、超长、乱码、格式错误
流程卡死、不结束、一直追问
敏感词、违规内容
状态异常、任务卡住
👉 这一类是纯代码自动抓 Bad Case - 模型 / Agent 自检识别(自己查自己)
反思模块 Self-Reflection
挑刺 Critic 对抗评审
如何使用bad case
- 原因:大模型有随机性、用户意图五花八门,永远写不全所有规则。只能通过:
用户用 → 出问题(bad case)→ 抓下来 → 改提示词 / 加规则 / 调 RAG / 限制流程 → 下次不再错
👉 靠真实失败案例,反向喂给系统,越用越稳
把线上抓到的错误案例倒流(反哺)加到评测题库里进行测试,测试改好、测稳了,再上线。循环迭代这个过程。整个过程包含:「线上采错→离线优化→评测验收→灰度上线」
- 错误案例的格式通常是JSON/结构化表格:
{
"case_id": "bad_20260426_001",
"error_type": "决策错误/幻觉/流程卡死/工具滥用/问诊不全",
"user_query": "用户原始问题",
"context_history": "完整上下文对话记录",
"agent_raw_output": "Agent 当时错误回答",
"expect_output": "标准正确答案/标准流程",
"reason": "错误根因:prompt缺失、知识库不足、路由错误、状态bug",
"create_time": "2026-04-26",
"fix_status": "未修复/已优化/已回归通过"
}

三、和反思机制的区别:
- 实时反思:单轮内即时纠错
这一轮回答错了,当场自检、当场修正,属于实时闭环 - Bad Case 反哺迭代:离线版本级优化
把全网共性错误收集,改系统本身,属于长期进化闭环
更多推荐


所有评论(0)