AI Agent 分层构建官方实操手册
目录
文档说明
适用人群
AI 开发人员、本地 Agent 部署学习者、大模型二次开发、电网 / 自动化业务脚本对接、桌面软件(Blender/3DMax/Unity)智能调度开发人员
手册作用
- 清晰区分原生对话大模型与可用 AI 智能体的硬性能力差距
- 对 Agent 每一层模块:规定【验收标准】【落地实施方案】【配套代码 / 组件选型】【故障现象 & 处理方案】
- 标准化开发流程,可直接依照本手册从零搭建一套可用的 Agent 框架
整体固定执行流水线(不可随意调换顺序)
前置基础:意图识别模块 正式链路:任务规划层 → 工具调用解析层 → 执行器环境交互层 → 多层记忆管理层 → 观测 & 反思纠错层 → 运行状态管理层 → 安全行为护栏层 → 结果聚合封装层
前置单元:意图识别模块(基础必备模块)
1. 强制验收标准
1)精准区分用户需求类型:纯文本问答需求 / 需要调用外部工具的实操任务需求 2)提取需求核心目标、限定条件、附加要求,过滤无效闲聊、无关话术 3)多轮对话下,可结合历史上下文修正用户真实意图,不会被单句片面文字误导
2. 落地实现方式
- 简易方案:系统 Prompt 约束 + 大模型自带语义理解能力
- 工程方案:独立小分类模型 / Prompt 路由分发器
3. 常见故障 & 解决
故障:用户表述口语化,识别错需求类型 处理:增加意图示例写入系统提示词,配置意图置信度阈值,低于阈值则反问用户确认需求
第一层:任务规划拆解层(Agent 总指挥中枢)
1、模块核心定位
普通 LLM 只具备一次性文本生成能力,无任务编排能力;本模块是 Agent 的逻辑大脑,负责把复杂大包任务拆分为有序可执行子任务。
2、硬性验收达标标准(必须全部满足才算合格)
1)复杂多目标任务,能够拆分出串行依赖、并行独立两类子任务;前置任务未完成,不会调度后置任务 2)支持动态适配:任务中途用户修改需求、执行报错,可实时重生成规划清单,不僵化执行原始计划 3)输出结构化任务列表,每条子任务标注:执行目的、所需工具、执行前置条件、任务优先级 4)自动剔除重复、无意义、逻辑矛盾的无效步骤
3、标准化落地实施方案表格
| 开发规模 | 推荐技术方案 | 配套配置说明 |
|---|---|---|
| 个人本地小项目 | CoT 思维链 + Plan-and-Solve 提示词模板 | 在系统 Prompt 强制模型输出 markdown 结构化任务表 |
| 中小型工程项目 | 独立规划 Agent(专用模型负责生成计划,主模型负责执行) | 计划生成后增加一轮自检 Prompt,校验步骤合理性 |
| 大型长期任务系统 | GoT 图思维架构,任务用有向图管理依赖关系 | 搭配任务持久化存储,支持中断后恢复计划 |
4、实操示例
用户原始需求:使用 Blender 绘制机箱壳体、边缘做倒角处理、导出 STL 格式文件 规划层标准输出结构: 任务 1:调取标准机箱长宽高行业参数 任务 2:调用 Blender 建模接口,依照参数绘制箱体轮廓(依赖任务 1 完成) 任务 3:调用倒角工具函数优化壳体边缘(依赖任务 2 完成) 任务 4:执行文件导出接口,输出 STL 文件(依赖任务 3 完成)
5、高频故障排查手册
| 故障现象 | 产生原因 | 解决手段 |
|---|---|---|
| 拆分步骤混乱,前后步骤颠倒 | Prompt 没有写明步骤依赖书写格式 | 给模型提供固定的任务书写模板 |
| 拆分步骤过于细碎 / 过度笼统 | 缺少步骤粒度示例 | 在提示词中增加 2~3 组标准拆分样例 |
| 报错后不会更新任务计划 | 规划模块和纠错模块无数据互通 | 把报错信息回传给规划层,触发重新规划逻辑 |
6、和普通对话模型差距
普通模型:仅用自然文字描述操作步骤,无法输出机器可读的任务清单,程序无法自动执行; Agent 规划层:产出标准化任务队列,程序可自动按顺序调度工具执行。
第二层:工具调用解析层(结构化指令生成单元)
1、模块核心定位
承接规划层子任务,对照工具库定义,生成机器可直接解析的标准 JSON 指令,是「模型思考」转为「程序指令」的关键转换层。
2、硬性验收达标标准
1)严格匹配 Function Schema 工具描述文档,输出 JSON 字段齐全:工具名称、函数名、入参、参数数据类型、入参补充说明 2)自动区分必填参数、选填参数,必填项缺失时主动向用户索要数据,不可生成残缺 JSON 3)输出内容纯净,只返回 JSON 文本,不夹杂多余中文解释、注释、废话文本 4)参数数值、格式符合对应接口要求,不会出现类型错误(字符串填写数字、数组格式错乱)
3、标准化落地实施方案
1)编写全局工具注册表:录入全部工具的名称、功能、入参结构、数据类型、填写示例,全部注入模型上下文 2)系统 Prompt 强约束:规定输出格式,违规格式直接判定无效 3)外层配套 JSON 语法校验脚本:模型输出内容先交由代码校验格式,格式错误原路回传给模型重新生成
4、实操标准 JSON 模板
{
"tool_name": "blender_export_file",
"function": "stl_export",
"params": {
"save_path": "D:/case/chassis.stl",
"precision": 0.01
}
}
5、高频故障排查手册
| 故障现象 | 产生原因 | 解决手段 |
|---|---|---|
| JSON 包裹 ```markdown 代码块 | Prompt 约束力度不足 | 在校验代码中增加字符串清洗逻辑,剔除标记符号 |
| 参数类型错误(数字写成字符串) | 缺少参数类型示例 | 在 Schema 内标注每个参数的类型样例 |
| 擅自调用未登记的工具 | 模型自由发挥 | 执行器增加工具名校白名单拦截 |
6、和普通对话模型差距
普通模型:只输出自然语言操作教程,计算机程序无法识别解读; Agent 工具解析层:标准结构化 JSON,程序可一键解析分发调用。
第三层:执行器 + 环境交互层(指令执行中转单元)
1、模块核心定位
纯中间调度服务,不参与逻辑思考,只负责解析 JSON 指令、调用对应程序、捕获执行结果(成功数据 / 报错日志),把执行回执回传给大模型。
2、硬性验收达标标准
1)精准建立「工具名 — 调用方法」映射关系,一一对应本地脚本、桌面软件 API、网络接口、系统命令 2)完整捕获执行全部返回信息:正常返回数据、运行报错、程序崩溃日志、超时无响应状态 3)兼容多类运行环境:Blender/3dMax 等桌面程序、HTTP 云端接口、Windows/Linux 系统命令、本地文件读写操作 4)具备超时熔断机制,单工具卡死时主动终止进程,不会造成整个 Agent 流程阻塞卡死
3、标准化落地实施方案
1)编写统一调度中枢代码,维护全局工具映射字典 2)桌面软件:使用进程调用、软件官方 RPC 接口、命令行参数唤起程序运行 3)网络接口:使用 HTTP/GRPC 请求完成远程工具调用 4)全局增加超时阈值(默认 30s),超出阈值自动终止进程并返回超时报错
4、执行完整流程
接收 JSON → 解析工具标识 → 匹配调用方法 → 拉起程序执行任务 → 采集运行结果 → 封装回执数据传回大模型
5、高频故障排查手册
| 故障现象 | 产生原因 | 解决手段 |
|---|---|---|
| 调用本地软件无响应 | 软件未开启后台服务、接口端口未开放 | 预先检测软件运行状态,未启动则自动拉起软件进程 |
| 执行成功但是无返回数据 | 程序输出流未捕获 | 配置标准输出、标准错误双路日志采集 |
| 频繁进程堆积占用内存 | 进程执行结束没有销毁 | 每次调用完成强制回收进程资源 |
6、和普通对话模型差距
普通模型:没有任何对接电脑软硬件的通道,文字指令永远无法真实操控软件; Agent 执行器:打通模型与本地所有程序的物理通道,让文字逻辑变成真实电脑操作行为。
第四层:多层记忆管理系统(Agent 记忆存储单元)
1、模块核心定位
普通对话模型仅有窗口内临时上下文,无长期记忆、任务过程记录;本模块分为短时、中长期、过程三层记忆,给 Agent 提供经验沉淀、上下文连贯能力。
2、硬性验收达标标准
短时记忆
1)完整保存本轮全流程对话记录、所有工具调用指令、工具返回回执,全程上下文不会断裂丢失 2)上下文超出模型窗口上限时,自动滑动剔除老旧无效数据,保留当前任务核心信息
中长期记忆
1)持久存储历史任务方案、过往报错案例、常用最优参数配置,模型可自主检索复用经验 2)支持语义相似度检索,同类任务自动匹配历史最优执行方案
过程记忆
1)逐条永久记录本次任务全部行为:调用时间、工具名称、入参内容、执行结果、运行状态 2)记录数据可导出、可检索,用于后期流程复盘、问题溯源排查
3、标准化落地实施方案
| 记忆类型 | 存储介质选型 | 部署方案 |
|---|---|---|
| 短时记忆 | 程序内存列表 + 模型上下文窗口 | 滑动窗口算法管理超长上下文 |
| 中长期记忆 | 向量数据库(个人用 Chroma,工程用 FAISS/Milvus) | 任务结束后将执行记录向量化入库;任务启动时检索相似历史记录 |
| 过程记忆 | 本地日志文件 / SQLite 轻量数据库 | 每条调用行为自动写入日志表,附带时间戳、任务 ID |
4、实操案例
上次调用 3ds Max 因尺寸参数格式报错,本次同类建模任务,向量库自动召回历史错误案例,模型自动规避错误参数。
5、高频故障排查手册
| 故障现象 | 产生原因 | 解决手段 |
|---|---|---|
| 上下文过长模型乱回答 | 无滑动窗口机制 | 设定上下文长度阈值,超限自动精简历史信息 |
| 记忆库数据越来越杂冗余 | 无数据清理规则 | 配置过期记忆自动清理策略 |
| 检索记忆内容不匹配 | 向量化拆分粒度不合理 | 以单条任务为最小单元做向量化存储 |
6、和普通对话模型差距
普通模型:对话清空、上下文溢出之后,所有历史经验全部清零; Agent 记忆系统:长期沉淀踩坑经验与最优方案,越使用执行准确率越高。
第五层:观测 & 反思 / 自我纠错模块(智能自愈单元)
1、模块核心定位
死板的工具调用只会机械执行指令;本模块是 Agent 具备自主修复能力的核心,读取执行结果、识别异常、分析报错、自动重试修复。
2、硬性验收达标标准
1)观测能力:自动区分工具执行结果:执行成功 / 参数报错 / 接口异常 / 运行崩溃 / 超时失败 2)反思能力:可读懂原始报错堆栈信息,精准定位出错根因(参数格式错误、文件路径不存在、接口权限不足等) 3)自愈重试:无需用户手动修改指令,自主修正参数、更换工具、重新生成规划步骤发起二次调用 4)配置最大重试次数阈值,避免无限死循环重试,达到上限后终止流程并上报异常
3、标准化落地实施方案
1)执行器回执统一附带状态字段:status(success/error)+ 原始 message 日志 2)报错信息拼接专用反思 Prompt 送入模型,要求输出标准化修正方案 3)全局配置默认最大重试次数:3 次,到达阈值直接终止任务并推送异常报告
4、实操案例
Blender 接口报错:尺寸入参为字符串,要求浮点数字 反思流程:解析报错原因 → 修改参数数据格式 → 重新生成 JSON 指令 → 执行器二次调用,全自动修复问题
5、高频故障排查手册
| 故障现象 | 产生原因 | 解决手段 |
|---|---|---|
| 报错后重复一模一样的错误调用 | 反思 Prompt 缺少错误定位要求 | 强制模型写明错误原因 + 修改方案两项内容 |
| 无限循环重试卡死程序 | 未设置重试上限 | 代码层面硬编码最大重试次数,不受模型输出控制 |
6、和普通对话模型差距
普通模型:拿到报错信息只能回复无关文字,没有任何修复动作; Agent 反思层:全自动闭环排错、重试执行,降低人工介入成本。
第六层:状态管理模块(全流程秩序管控单元)
1、模块核心定位
原生大模型属于无状态服务,每次问答互相独立;本模块使用有限状态机(FSM)管控 Agent 全局运行状态,约束任务流转顺序、资源并发冲突。
2、硬性验收达标标准
1)实时标记当前运行状态:空闲、任务运行中、等待工具回执、任务异常暂停、任务正常完成、任务强制终止 2)管控多任务串行、并行逻辑,规避多软件同时调用产生端口占用、资源抢占冲突 3)支持外部下发指令:任务暂停、恢复运行、强制终止后台进程,后台程序不会无管控常驻运行 4)状态切换存在固定流转规则,不允许跨状态随意跳转
3、标准化落地实施方案
1)采用有限状态机 FSM框架编写状态流转规则,绘制状态流转图谱 2)多任务请求使用消息队列排队执行,串行任务依照队列顺序依次运行 3)每条任务分配唯一 TaskID,所有进程绑定 ID,支持精准终止对应进程
标准状态流转路径
空闲 → 接收任务 → 规划解析 → 执行调用 → 等待回执 → 处理结果 → 回到空闲 / 异常暂停
4、实操案例
用户同时下发建模、导出文件两条指令,状态机先进入建模执行状态,收到建模成功回执后,才切换状态执行导出任务,不会并发抢占 Blender 进程。
5、高频故障排查手册
| 故障现象 | 产生原因 | 解决手段 |
|---|---|---|
| 多个任务并发导致软件崩溃 | 无队列限流机制 | 接入本地任务队列,串行排队执行本地软件调用 |
| 任务终止后进程残留后台运行 | 状态终止没有配套进程销毁逻辑 | 任一终止状态触发时,强制回收全部关联进程 |
6、和普通对话模型差距
普通模型:无任何运行状态概念,问答完全孤立,不存在流程管控; Agent 状态机:全程有序可控,任务生命周期全程可监控、可管理。
第七层:行为约束与安全护栏模块(操作边界隔离单元)
1、模块核心定位
普通模型仅做文本内容安全审核,管控不到真实电脑操作;本模块限制 Agent 可执行行为范围,杜绝高危操作破坏本地文件、系统配置。
2、硬性验收达标标准
1)工具白名单机制:仅放行配置内登记的工具调用,名单以外的指令直接拦截拒绝执行 2)文件读写路径黑名单:仅允许访问指定工作文件夹,禁止访问系统目录、隐私文件、磁盘根目录 3)拦截高危系统指令:格式化磁盘、批量删除文件、修改注册表、系统权限篡改等操作直接阻断 4)二次校验高危行为指令,多层防护,不会被模型 Prompt 注入绕过防护规则
3、标准化落地实施方案
1)编写全局工具白名单,执行器优先匹配名单,非名单工具直接丢弃 JSON 指令 2)文件操作统一配置工作根目录,代码强制路径校验,超出目录的读写请求直接拦截 3)高危系统命令配置关键字黑名单,命中关键字直接终止调用流程 4)高危操作增加二次大模型安全复核
4、实操案例
Agent 生成删除本地文件夹的指令,安全模块匹配高危行为,直接拦截这条指令下发至执行器,保护本地数据安全。
5、高频故障排查手册
| 故障现象 | 产生原因 | 解决手段 |
|---|---|---|
| 正常业务文件操作被误拦截 | 白名单路径配置错误 | 精准配置项目工作目录,放宽目录内操作权限 |
| 模型拼接字符串绕过关键词拦截 | 单纯关键词匹配存在漏洞 | 结合语义识别 + 关键词双重校验高危行为 |
6、和普通对话模型差距
普通模型:只能审核输出文字是否违规,无法管控真实的本地系统操作; Agent 安全护栏:从指令下发源头拦截危险行为,守护本机软硬件、文件数据安全。
第八层:结果聚合封装模块(成果输出整理单元)
1、模块核心定位
所有子任务全部执行完毕后,汇总全部运行数据、文件路径、执行日志,把机器原始数据转换成普通人可读的规整结果交付用户。
2、硬性验收达标标准
1)汇总全链路数据:工具返回数据、生成文件存储路径、所有步骤执行日志、异常告警信息 2)结构化排版输出内容,分为:任务成果说明、文件存放地址、执行过程简述、异常备注四块内容 3)隐藏底层原始 JSON、报错堆栈等技术信息,给到用户简洁易懂的自然语言反馈
3、标准化落地实施方案
1)任务全部闭环后,汇总整条链路所有回执数据统一送入大模型 2)固定输出模板 Prompt,约束输出格式,保证反馈内容规整统一
4、实操案例
机箱建模 + STL 导出全部完成,聚合模块汇总文件路径、建模尺寸参数、执行全程记录,整理成通俗文字告知用户文件位置与任务完成状态。
5、高频故障排查手册
| 故障现象 | 产生原因 | 解决手段 |
|---|---|---|
| 输出信息杂乱堆砌大量原始日志 | 未约束输出过滤规则 | Prompt 明确要求屏蔽底层技术日志,只展示用户关心内容 |
| 遗漏重要产出文件地址 | 未强制抓取文件路径字段 | 规定必须提取文件路径写入最终回复 |
6、和普通对话模型差距
普通模型:回答内容只来源于训练知识库,拿不到软件真实运行产生的文件、实测数据; Agent 聚合层:依托真实软件运行结果反馈真实落地成果,信息具备真实性。
附录 1:整体架构总对比对照表
| 对象 | 核心能力范围 | 运行闭环范围 | 能否操控本地软件 |
|---|---|---|---|
| 原生普通对话大模型 | 文本理解 + 文本续写生成 | 纯文字虚拟闭环 | 完全不支持 |
| 完整架构 AI Agent | 八大模块全套能力 + LLM 内核 | 思考→指令→软件执行→真实结果→迭代优化实体闭环 | 完美适配 Blender、Unity、系统脚本、各类 API 调用 |
附录 2:新手部署最简落地优先级顺序
- 优先搭建:工具调用解析层 + 执行器(实现基础调用功能)
- 叠加:任务规划层 + 过程日志记忆
- 补充:观测反思纠错模块,实现基础报错自愈
- 完善:状态机管理 + 安全护栏
- 最后优化:长短记忆向量库 + 结果聚合美化输出
更多推荐

所有评论(0)