大模型微调 (Fine-tuning) 对 Agent 能力的提升
大模型微调 (Fine-tuning) 对 Agent 能力的提升:从基础工具到通用协作伙伴的跃迁路径
1. 引入与连接:当你想让“通用大百科”变成“专属CEO助理Agent”时的困境与破局
核心概念
(提前锚定金字塔基础层的第一个锚点:通用预训练大模型(Base LLM)、大模型微调(Fine-tuning)、**AI Agent(自主智能体)**的生活化+初步技术双定义)
生活化初步定义
想象一个场景:你刚拿到一本刚印刷完的、收录了人类2023年之前几乎所有公开知识的**《超级通用大百科全书2023》——这本书有个神奇的魔法:你问任何问题,它都能在0.5秒内翻到相关的几十页甚至几百页,再用流畅、准确的语言给你总结。这就是通用预训练大模型(Base LLM)**。
但现在,你的问题升级了:“大百科啊大百科,请你明天帮我做这三件事:1. 整理昨晚公司产品部和技术部那场争吵录音里的所有非公开技术细节、待办优先级、双方负责人私下的小让步/硬坚持,并生成一份带决策树的产品迭代简报;2. 用我公司专用的PPT模板(字体是微软雅黑加粗标题、思源黑体细文,配色只有绿蓝灰三种主色,每页右下角必须加带二维码的‘保密级仅限XX团队内部传阅’水印),把简报做成25页以内的可演示版本;3. 把简报的技术部分用加密压缩包(密码规则是‘产品部经理生日-技术部经理入职年份后两位’:王小明19850723,李小红2019)发给王小明和李小红,抄送给我,然后在邮件末尾自动加一段‘请于明天下午3点前回复确认/补充意见,逾期默认通过待办优先级排序前3项的迭代计划’的固定话术,还要追踪明天下午3点前的邮件回复状态,如果有补充意见,要立刻整理成‘新增/调整待办事项清单’再抄送给所有人。”
这时候,《超级通用大百科全书2023》大概率会给你一个“哦?这个录音在哪?PPT模板的路径是什么?公司的邮件服务器地址是多少?王小明李小红的具体邮箱?还有密码规则里的生日入职年份后两位我怎么知道?‘追踪回复状态’的功能我也没法自己去操作人类的邮件系统啊!”的无力回应——即使勉强给出录音整理、PPT内容、邮件草稿的通用建议,也完全不符合你的专属场景、专属规则、专属工具链、专属业务目标。
这时候,你需要做两件事:
- 给这本大百科装上**“能看到/听到/操作外部世界”的“眼睛、耳朵、手”和“大脑指挥手脚的中枢”——这就是AI Agent(自主智能体)的基础结构组件**:感知模块(Perception)、工具调用模块(Tool Use)、决策规划模块(Decision Making & Planning)、执行反馈模块(Execution & Feedback);
- 把这本大百科从头到尾“补习”一遍:给它塞你的公司的保密规则、专属PPT模板、所有人的邮箱/生日/入职时间等隐私但必要的信息、昨晚那场争吵录音的完整文本、处理这类争吵迭代的历史案例、你对邮件追踪这类自动化操作的具体需求细节——而且不是让它“死记硬背”零散知识点,而是让它形成一套符合你公司文化、工作流程、业务目标的“思维模式和行动准则”——这就是大模型微调(Fine-tuning)对Agent的核心价值基础。
初步技术定义
为了后面的讨论严谨,我们再给三个核心概念下一个初步的、不含数学细节的技术定义:
- 通用预训练大模型(Base LLM):
核心属性:一个基于海量通用公开文本/多模态数据(文本为主,可能包含图片、音频、视频的文本化或直接嵌入)训练的自回归/掩码语言模型(现在主流是GPT系列的自回归模型,我们主要围绕自回归模型讨论,除非特别说明);
核心目标:预测下一个最合理的token(可以理解为语言的最小单位:中文的一个字/词、英文的一个单词/词根词缀等);
核心能力:通用知识问答、通用文本生成、通用代码生成、通用逻辑推理——但这些能力都是“泛化的、不针对特定场景的、通常没有严格遵循特定规则的、无法直接自主操作外部工具完成闭环任务的”。 - 大模型微调(Fine-tuning):
核心属性:在已经完成海量通用数据预训练的Base LLM基础上,使用特定领域/特定场景/特定任务的标注/弱标注/伪标注数据,用相对较小的算力(相比预训练,通常是预训练算力的1/1000到1/100000),对Base LLM的全部参数(全量微调,Full Fine-tuning)或部分参数(参数高效微调,Parameter-Efficient Fine-tuning,PEFT,主流包括LoRA、QLoRA、Adapter、Prefix Tuning、P-Tuning v2等) 进行有监督/半监督/强化学习式的调整;
核心目标:让Base LLM的泛化能力“聚焦”到特定领域/特定场景/特定任务上,形成符合特定规则的、稳定的、可重复的、高质量的输出能力,甚至在某些特定任务上超过泛化能力更强的更大规模Base LLM;
核心价值基础(为Agent量身定制的):记忆专属信息(隐私但必要的、无法通过上下文窗口Context Window容纳的长期记忆)、遵循专属规则(业务流程、格式要求、伦理准则等)、优化特定Agent核心能力(比如决策规划能力、工具调用能力、专业领域的逻辑推理能力等)、降低推理延迟/提升推理稳定性/减少幻觉(Hallucination)——这些都是通用Prompt Engineering(提示词工程)很难或无法长期、稳定、高效解决的问题。 - AI Agent(自主智能体,为大模型时代的Agent量身定制,区别于传统强化学习的Agent):
核心属性:一个以大模型为“大脑中枢(LLM Core)”,搭配感知模块、记忆模块(Memory,分为短期Context Window记忆和长期Vector Database/Graph Database记忆)、工具调用模块、决策规划模块、执行反馈模块组成的**“感知-记忆-决策-规划-执行-反馈-优化”闭环系统**;
核心目标:自主地、高效地、准确地完成用户指定的、复杂的、多步骤的、需要调用外部工具/与外部环境交互的闭环任务——而不是像Base LLM那样只能做“问答式的、非闭环的、单步骤的”任务;
核心能力(按依赖LLM Core的程度从高到低排序):复杂自然语言理解(NLU)、复杂任务拆解、决策规划、长期记忆管理、工具调用理解与选择、执行监控与反馈处理、错误修复、自主学习(如果加入了强化学习或在线微调的话)——其中,任务拆解、决策规划、工具调用选择、长期记忆索引、错误修复这几个核心能力,是Prompt Engineering能做一部分优化,但只有通过Fine-tuning才能做大规模、长期、稳定、高质量提升的能力。
问题背景
从“大模型元年的狂热”到“Agent落地的冷静期”:2023-2025年的行业演变
为了让你更直观地理解为什么我们现在要讨论“Fine-tuning对Agent能力的提升”,我们先来看一段2023-2025年大模型+Agent行业的简短发展史(后面多维透视部分会有更详细的markdown表格和ER实体关系图):
-
2023年上半年:大模型元年的狂热,Prompt Engineering的“万能神话”
2022年11月30日OpenAI发布GPT-3.5-turbo,2023年3月14日发布GPT-4和Plugin(工具调用)功能——这两个发布直接点燃了全球对大模型的狂热。当时,很多人(包括很多技术从业者、投资人、创业者)都认为:Prompt Engineering是唯一需要的“大模型定制化方法”,只要把提示词写得足够好(比如用Chain-of-Thought,CoT;Tree-of-Thought,ToT;Self-Consistency,SC;Few-Shot Learning,FSL;Zero-Shot-CoT,ZS-CoT等技巧),就能让Base LLM变成任何想要的Agent,甚至能直接解决所有复杂的、多步骤的、闭环的任务。那段时间,确实出现了很多“基于Prompt Engineering的Agent原型”:比如AutoGPT、BabyAGI、AgentGPT、LangChain的早期Agent框架等——这些原型在演示视频里看起来非常神奇:AutoGPT能自己搜索新闻、自己写Python代码、自己运行代码、自己分析结果、自己生成下一步的行动计划,甚至能自己“赚零花钱”(演示视频里AutoGPT自己开了个Shopify店铺,卖自己生成的AI图片)。
但很快,这些“演示级别的Agent原型”就遇到了落地的“三座大山”:
- 幻觉(Hallucination)问题:演示视频里AutoGPT能“赚零花钱”,但实际落地时,AutoGPT经常会生成“不存在的产品链接、不存在的代码库、不存在的API接口、不存在的用户反馈”——这些幻觉会直接导致任务失败,甚至会造成经济损失或法律风险;
- 工具调用不稳定问题:演示视频里AutoGPT能“流畅地调用搜索、Python解释器、文件读写等工具”,但实际落地时,AutoGPT经常会“调用错误的工具、传递错误的参数、格式不符合工具要求的输入、无法理解工具返回的结果”——这些工具调用错误会导致任务卡壳,甚至会无限循环(“死锁”问题);
- 长期记忆不足问题:演示视频里AutoGPT处理的都是“10步以内的、短期的、不涉及大量隐私/专属信息的任务”,但实际落地时,Agent需要处理的是“成百上千步的、长期的、涉及大量无法通过Context Window容纳的隐私/专属信息的任务”——比如,一个电商运营Agent需要记住“过去3年所有产品的销售数据、所有用户的购买历史、所有供应商的合作规则、所有促销活动的历史效果、公司的保密规则、老板的喜好”——这些信息如果都塞进Context Window,不仅会导致推理成本大幅上升(GPT-4的128K Context Window推理成本是GPT-3.5-turbo 4K的几十倍甚至上百倍),还会导致LLM Core“注意力分散”,无法关注到当前任务最需要的关键信息。
除了这“三座大山”,还有推理延迟高、推理成本高、输出不稳定、无法遵循严格的专属规则、泛化到新的子任务能力弱等问题——这些问题直接导致了2023年下半年大模型+Agent行业进入了“冷静期”:很多基于Prompt Engineering的Agent原型项目停摆,很多投资人开始观望,很多创业者开始思考“到底什么样的方法才能让Agent真正落地?”。
-
2023年下半年-2024年上半年:参数高效微调(PEFT)的崛起,Fine-tuning+Prompt Engineering的“混合定制化方法”初露锋芒
其实,早在GPT-3时代(2020年),OpenAI就已经推出了全量微调服务,但当时全量微调的成本太高(比如微调一个175B参数的GPT-3模型,需要几十万美元甚至上百万美元的算力成本),而且全量微调会“遗忘”Base LLM的很多泛化能力(“灾难性遗忘”问题,Catastrophic Forgetting)——所以全量微调服务在当时并没有得到大规模的应用。直到2021-2023年,参数高效微调(PEFT)技术陆续成熟:
- 2021年,微软亚洲研究院(MSRA)的刘铁岩团队和清华大学的唐杰团队合作推出了LoRA(Low-Rank Adaptation,低秩适配)——LoRA通过在Transformer的Attention层(QKV投影层,有时也会加在FFN层)添加“低秩矩阵分解的可训练参数模块”,而不是修改Base LLM的任何原有参数,来实现“用极小的参数量(通常是Base LLM参数量的0.01%到1%),达到接近甚至超过全量微调的效果,同时完全避免灾难性遗忘问题,推理时也可以把LoRA模块合并到Base LLM的原有参数里,不会增加推理延迟或推理成本”;
- 2023年,亚利桑那州立大学的Tim Dettmers团队推出了QLoRA(Quantized Low-Rank Adaptation,量化低秩适配)——QLoRA通过在LoRA的基础上,把Base LLM的原有参数量化到4位(NF4量化,Normalized Float 4-bit Quantization,专门为大模型设计的量化方法,能最大程度地保留量化后的模型性能),同时添加“Double Quantization(双量化)”和“Paged Optimizers(分页优化器)”来进一步降低显存占用——这使得即使在只有16GB VRAM的消费级显卡(比如NVIDIA RTX 3090、RTX 4090、RTX A5000等)上,也能微调一个70B参数的大模型(比如Llama 2 70B、Falcon 180B太大了,但Llama 3 70B如果用更优化的方法也有可能)——QLoRA的推出直接把大模型微调的门槛从“几十万美元的企业级GPU集群”降到了“几千美元的消费级显卡”,这也直接导致了2023年下半年-2024年上半年PEFT技术的大规模应用;
- 除了LoRA和QLoRA,还有很多其他的PEFT技术也在陆续成熟:比如Adapter(2019年,微软推出的最早的PEFT技术之一)、Prefix Tuning(2021年,斯坦福大学推出的专门针对文本生成任务的PEFT技术)、P-Tuning v2(2022年,清华大学推出的专门针对掩码语言模型,但也能很好地应用于自回归模型的PEFT技术)等。
随着PEFT技术的大规模应用,很多技术从业者、投资人、创业者开始意识到:Prompt Engineering和Fine-tuning(尤其是PEFT)不是“非此即彼”的关系,而是“相辅相成”的关系——Prompt Engineering适合处理“短期的、灵活的、需要快速迭代的、不涉及大量无法通过Context Window容纳的隐私/专属信息的子任务”,而Fine-tuning(尤其是PEFT)适合处理“长期的、稳定的、需要严格遵循专属规则的、涉及大量无法通过Context Window容纳的隐私/专属信息的、需要提升Agent核心能力的核心逻辑”。
那段时间,确实出现了很多“基于Fine-tuning+Prompt Engineering的混合定制化方法的Agent落地案例”:比如OpenAI的Custom GPTs(Custom GPTs本质上是“Prompt Engineering+知识库RAG(Retrieval-Augmented Generation,检索增强生成)+有限的Fine-tuning(如果用户上传了大量的专属数据,OpenAI可能会在后台对GPT-3.5-turbo/GPT-4做一些有限的Fine-tuning)”的组合,但Fine-tuning的部分是黑盒的,用户无法控制)、Anthropic的Claude Pro的Projects(类似Custom GPTs,但更强调长期记忆和工具调用)、谷歌的Gemini Advanced的Custom Models(用户可以上传专属数据,对Gemini Pro做有限的Fine-tuning,然后把Fine-tuning后的模型作为Agent的LLM Core)、国内的智谱AI的GLM-4的Custom Agents、字节跳动的豆包的Custom Agents、阿里巴巴的通义千问的Custom Agents等——这些落地案例虽然还不能完全解决Agent落地的所有问题,但已经比之前的“演示级别的Agent原型”好了很多:幻觉问题有所缓解、工具调用稳定性有所提升、长期记忆不足问题有所缓解、输出更稳定、能更好地遵循严格的专属规则。
-
2024年下半年-2025年(现在):Fine-tuning对Agent核心能力的“深度提升”成为行业研究和落地的重点,多模态Fine-tuning、强化学习微调(RLHF、RLAIF、RL with Human Feedback on Tools, RLHF-T;RL with AI Feedback on Tools, RLAIF-T)、在线微调(Online Fine-tuning)、联邦微调(Federated Fine-tuning)等新技术陆续成熟并开始应用
随着“基于Fine-tuning+Prompt Engineering的混合定制化方法的Agent落地案例”越来越多,很多技术从业者、投资人、创业者开始意识到:之前的Fine-tuning(主要是基于有监督微调SFT,Supervised Fine-tuning的PEFT)主要提升的是Agent的“自然语言理解和生成能力”“记忆专属信息的能力”“遵循严格专属规则的能力”,但Agent的“核心闭环能力”——比如“复杂任务拆解能力”“长期决策规划能力”“智能工具调用选择能力”“执行监控与反馈处理能力”“错误修复能力”“自主学习能力”——并没有得到“深度提升”——这些“核心闭环能力”才是Agent能否真正“自主地、高效地、准确地完成复杂的、多步骤的、闭环的任务”的关键。所以,从2024年下半年开始,行业研究和落地的重点就转移到了“Fine-tuning对Agent核心闭环能力的深度提升”上,同时也有很多新技术陆续成熟并开始应用:
- 多模态Fine-tuning:之前的Fine-tuning主要是基于文本数据的,但现在的Agent越来越多地需要处理多模态数据(比如图片、音频、视频)——所以多模态Fine-tuning(比如对Llama 3 Vision、GPT-4o、Gemini 1.5 Pro Vision、GLM-4V、通义千问Vision等多模态大模型做SFT/RLAIF/在线微调)成为了提升Agent感知能力的关键;
- 强化学习微调(RL with Feedback on Tasks, RLF-T,包括RLHF-T和RLAIF-T):之前的Fine-tuning主要是基于有监督微调SFT的——SFT需要大量的“输入-输出”对的标注数据,而且这些标注数据通常是“静态的、单步的、非闭环的”——但Agent的核心闭环能力是“动态的、多步的、闭环的”——所以强化学习微调(RLF-T)成为了提升Agent核心闭环能力的关键:RLF-T不需要大量的“输入-输出”对的标注数据,只需要“任务成功/失败的反馈信号”或者“人类/AI对Agent多步执行过程的每一步的反馈信号”——RLF-T能让Agent“在实践中学习”,不断优化自己的核心闭环能力;
- 在线微调(Online Fine-tuning):之前的Fine-tuning主要是“离线的、批量的”——也就是说,Agent在落地前先做一次离线的批量微调,然后在落地后就不再做微调了——但现实世界是“动态变化的”:公司的业务规则会变、公司的专属数据会变、外部环境会变、用户的需求会变——所以在线微调(Online Fine-tuning)成为了让Agent“持续学习、持续优化、持续适应动态变化的现实世界”的关键:在线微调能让Agent在落地后,根据“实时的执行反馈信号”或者“实时的新增专属数据”,对自己的LLM Core(主要是PEFT模块)做实时的、小批量的微调;
- 联邦微调(Federated Fine-tuning):之前的Fine-tuning主要是“集中式的”——也就是说,所有的专属数据都需要上传到一个“中央服务器”,然后在中央服务器上做微调——但很多专属数据是“隐私敏感的”(比如医疗数据、金融数据、企业的核心商业机密数据),不能上传到中央服务器——所以联邦微调(Federated Fine-tuning)成为了让“多个拥有隐私敏感专属数据的机构/用户,在不共享原始数据的前提下,共同训练一个共享的Agent LLM Core”的关键:联邦微调的核心思想是“数据不动,模型动”——每个机构/用户在本地对共享的Base LLM Core的PEFT模块做小批量的微调,然后只把微调后的PEFT模块的“参数更新量”上传到中央服务器,中央服务器对所有的参数更新量做“聚合”(比如FedAvg,联邦平均算法),然后把聚合后的PEFT模块的参数更新量下发给所有的机构/用户,所有的机构/用户再用聚合后的参数更新量更新自己本地的PEFT模块——这样,所有的机构/用户都能得到一个“结合了所有机构/用户的专属数据的优势,但没有泄露任何原始隐私敏感数据的”共享的Agent LLM Core。
问题描述
当我们讨论“Fine-tuning对Agent能力的提升”时,我们到底在讨论什么?——Agent能力的分层定义与Fine-tuning能/不能解决的问题
为了让我们的讨论更聚焦、更有逻辑,我们先对Agent能力做一个分层的、结构化的定义(这个定义是基于前面的知识金字塔构建者的教学理念,由浅入深、由通用到专属、由单步到多步闭环的),然后再分别讨论Fine-tuning(主要是PEFT,包括SFT、RLF-T、在线微调、联邦微调等)能解决这个分层定义里的哪些问题,不能解决哪些问题,以及Prompt Engineering、RAG、工具链优化等其他方法能解决哪些问题——这样,我们就能清楚地知道“Fine-tuning在Agent定制化方法里的定位是什么,它的核心价值是什么,它的边界是什么”。
Agent能力的分层定义(五层金字塔结构,对应知识金字塔的四层+整合层的一部分)
1. 基础感知与记忆能力层(Agent五层金字塔的第一层,对应知识金字塔的基础层)
这一层是Agent的“眼睛、耳朵、鼻子、嘴巴、短期记事本、长期图书馆”,是Agent完成任何任务的前提条件——如果Agent没有这一层能力,它就无法“感知外部世界的信息”,也无法“记住自己之前做过的事情、学到的知识、用户的需求”,更无法完成任何后续的任务。
这一层的具体能力包括:
- 多模态感知能力:理解文本、图片、音频、视频等多模态数据的能力;
- 短期Context Window记忆能力:记住当前对话/任务上下文里的信息的能力(通常是几千到几百万个token,取决于LLM Core的Context Window大小);
- 长期记忆管理能力:
- 把短期Context Window记忆里的“重要信息”(比如用户的生日、公司的保密规则、产品的核心参数、之前任务的执行结果等)存储到长期记忆库(Vector Database/Graph Database)的能力;
- 从长期记忆库中“检索”当前任务最需要的“关键信息”的能力(RAG的核心能力,本质上是“长期记忆管理能力的一部分”,但通常会单独拿出来讨论);
- 对长期记忆库中的“信息”进行“更新、删除、分类、索引”的能力。
2. 通用自然语言理解与生成能力层(Agent五层金字塔的第二层,对应知识金字塔的连接层的一部分)
这一层是Agent的“通用翻译官、通用文案、通用程序员、通用逻辑思考者”,是Agent完成“单步的、非闭环的、通用的”任务的核心能力——但这一层能力是“泛化的、不针对特定场景的、通常没有严格遵循特定规则的”。
这一层的具体能力包括:
- 通用自然语言理解(NLU)能力:理解用户的“指令、问题、需求、情绪”等文本/语音输入的能力;
- 通用自然语言生成(NLG)能力:生成“流畅、准确、通顺、符合语法”的文本/语音输出的能力;
- 通用代码理解与生成能力:理解和生成“Python、Java、C++、JavaScript、SQL等常见编程语言的代码”的能力;
- 通用逻辑推理能力:完成“数学推理、常识推理、因果推理、演绎推理、归纳推理”等通用逻辑推理任务的能力。
3. 特定场景/特定规则的理解与遵循能力层(Agent五层金字塔的第三层,对应知识金字塔的连接层的另一部分+深度层的第一层)
这一层是Agent的“专属秘书、专属合规官、专属格式编辑器”,是Agent完成“单步的、非闭环的、特定场景的、需要严格遵循特定规则的”任务的核心能力——这一层能力是“Prompt Engineering能做一部分优化,但只有通过Fine-tuning(尤其是基于SFT的PEFT)才能做大规模、长期、稳定、高质量提升的”。
这一层的具体能力包括:
- 特定场景的自然语言理解与生成能力:理解和生成“特定场景(比如医疗、金融、法律、电商、教育、企业内部办公等)的专业术语、专业逻辑、专业文案”的能力;
- 严格专属规则的遵循能力:严格遵循“格式规则(比如PPT模板格式、Word文档格式、邮件格式、代码注释格式等)、业务流程规则(比如报销流程、请假流程、产品迭代流程、合同审批流程等)、保密规则(比如哪些信息可以说,哪些信息不能说,哪些信息可以发给谁,哪些信息不能发给谁等)、伦理准则(比如不能生成有害的、虚假的、歧视性的内容等)”的能力;
- 特定场景的长期记忆索引与存储能力:更好地“从特定场景的长期记忆库中检索关键信息”和“把特定场景的重要信息存储到长期记忆库的正确位置”的能力(比如,医疗Agent能更好地从患者的电子病历长期记忆库中检索“患者过去3年的高血压病史、用药史、过敏史”等关键信息,而不是检索“患者过去3年的旅游记录、购物记录”等无关信息)。
4. 单步工具调用理解与执行能力层(Agent五层金字塔的第四层,对应知识金字塔的深度层的第二层)
这一层是Agent的“专属工具使用者”,是Agent完成“单步的、需要调用外部工具的、非闭环的”任务的核心能力——比如,Agent能“调用搜索工具搜索最新的新闻”“调用计算器计算数学题”“调用文件读写工具读取/写入文件”“调用API接口调用外部服务”等。
这一层的具体能力包括:
- 工具描述理解能力:理解“工具的名称、工具的功能、工具的输入参数要求、工具的输出格式、工具的使用限制”等工具描述的能力;
- 工具选择能力:根据“用户的当前指令/需求”,从“可用的工具列表”中选择“最适合的工具”的能力;
- 工具参数生成能力:根据“用户的当前指令/需求”和“工具的输入参数要求”,生成“格式正确、内容准确”的工具输入参数的能力;
- 工具输出理解能力:理解“工具返回的输出结果”的能力;
- 工具使用限制遵循能力:严格遵循“工具的使用频率限制、工具的使用时长限制、工具的使用权限限制”等工具使用限制的能力。
5. 复杂多步闭环任务的核心能力层(Agent五层金字塔的第五层,对应知识金字塔的深度层的第三层+整合层)
这一层是Agent的“专属CEO、专属项目经理、专属问题解决者”,是Agent能否真正“自主地、高效地、准确地完成复杂的、多步骤的、闭环的、需要与外部环境交互的”任务的最核心、最关键的能力——这一层能力是“Prompt Engineering能做一部分优化,但只有通过Fine-tuning(尤其是基于RLF-T的PEFT、在线微调的PEFT)才能做大规模、长期、稳定、高质量提升的”。
这一层的具体能力包括:
- 复杂任务拆解能力:把用户指定的“复杂的、模糊的、多步骤的、闭环的”大任务,拆解成“简单的、明确的、单步的、可执行的”小任务/子任务的能力——比如,把“帮我筹备明天的产品发布会”这个大任务,拆解成“整理产品发布会的议程、联系所有的参会人员并确认他们的参会时间和地点、准备产品发布会的演示文稿、准备产品发布会的礼品、布置产品发布会的场地、调试产品发布会的音响和投影仪设备、安排产品发布会的餐饮和交通、在产品发布会当天现场协调所有的事情”等小任务/子任务;
- 长期决策规划能力:根据“拆解后的小任务/子任务的依赖关系、重要性、紧急性、可用的工具、可用的资源、外部环境的情况”,制定“合理的、高效的、可执行的”长期执行计划的能力——比如,确定哪些小任务/子任务可以并行执行,哪些小任务/子任务必须串行执行,哪些小任务/子任务应该优先执行,哪些小任务/子任务可以延后执行;
- 智能工具链调用能力:根据“长期执行计划”,“顺序地、并行地、条件判断地、循环地”调用多个工具,组成“工具链”,来完成拆解后的小任务/子任务的能力——比如,为了完成“整理产品发布会的议程”这个小任务,Agent需要“先调用文件读写工具读取之前的产品发布会的历史议程模板,再调用长期记忆库的RAG检索产品发布会的最新要求和参会人员的特殊需求,再调用自然语言生成工具根据历史议程模板、最新要求和特殊需求生成新的产品发布会的议程,再调用文件读写工具把新的议程保存到指定的路径,再调用邮件工具把新的议程发给产品经理确认”;
- 执行监控与反馈处理能力:在执行长期执行计划的过程中,“实时监控”每个小任务/子任务的执行状态和执行结果,“实时处理”工具返回的错误结果或外部环境的变化,“实时调整”长期执行计划的能力——比如,如果调用邮件工具把新的产品发布会的议程发给产品经理确认后,产品经理回复说“议程里的第三个演示环节的时间太长了,应该从30分钟缩短到20分钟,而且演示嘉宾应该换成李小红而不是王小明”,Agent需要“实时调整”产品发布会的议程,“实时调整”演示环节的演示内容,“实时联系”李小红确认她的演示时间,“实时联系”王小明取消他的演示,“实时把调整后的议程发给所有的参会人员”;
- 错误修复与自我优化能力:在执行长期执行计划的过程中,如果遇到“工具调用错误、任务执行失败、用户不满意执行结果”等问题,“自主地、高效地、准确地”修复错误的能力——以及在完成任务后,根据“用户的反馈信号”或者“任务执行的结果数据”,“自主地、持续地”优化自己的核心能力的能力(自主学习能力);
- 多Agent协作能力:如果一个复杂的、多步骤的、闭环的任务需要多个Agent(比如产品Agent、技术Agent、运营Agent、财务Agent、HR Agent等)共同完成,“自主地、高效地、准确地”与其他Agent进行“沟通、协调、分工、合作”的能力。
Fine-tuning能/不能解决的Agent能力问题(以及其他方法的定位)
现在,我们已经对Agent能力做了一个分层的、结构化的定义,接下来我们就分别讨论Fine-tuning(主要是PEFT,包括SFT、RLF-T、在线微调、联邦微调等)能解决这个分层定义里的哪些问题,不能解决哪些问题,以及Prompt Engineering、RAG、工具链优化、感知模块优化、记忆模块优化等其他方法能解决哪些问题——这样,我们就能清楚地知道“Fine-tuning在Agent定制化方法里的定位是什么,它的核心价值是什么,它的边界是什么”。
为了让这个讨论更直观、更清晰,我们先做一个概念核心属性维度对比的markdown表格(对比Fine-tuning、Prompt Engineering、RAG、工具链优化这四个Agent定制化的核心方法的核心属性、能解决的Agent能力问题、不能解决的Agent能力问题、优缺点、适用场景):
| 核心方法 | 核心属性 | 能解决的Agent能力问题 | 不能解决的Agent能力问题 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|---|---|---|
| Fine-tuning(PEFT为主) | 在Base LLM的基础上,用特定数据调整部分/全部参数,聚焦能力,形成专属思维模式 | 1. 第三层:特定场景/特定规则的理解与遵循能力; 2. 第四层:单步工具调用理解与执行能力的稳定性和准确性; 3. 第五层:复杂多步闭环任务的核心能力(拆解、规划、工具链、监控反馈、错误修复、自主学习、多Agent协作); 4. 减少幻觉、降低推理延迟、提升输出稳定性 |
1. 第一层:基础多模态感知能力(除非做多模态Fine-tuning,但感知硬件的限制还是无法解决)、短期Context Window记忆能力(除非换更大Context Window的Base LLM); 2. 第一层:长期记忆库的存储容量(只能优化索引和存储位置,无法增加存储容量); 3. 第四层:工具本身的功能限制(比如工具没有搜索功能,Fine-tuning也无法让Agent调用不存在的搜索功能) |
1. 能力提升大规模、长期、稳定、高质量; 2. 能记忆专属信息(无法通过Context Window容纳的长期记忆); 3. 能严格遵循专属规则; 4. 能深度提升Agent的核心闭环能力; 5. 能减少幻觉、降低推理延迟、提升输出稳定性; 6. PEFT的算力成本低、门槛低、不会灾难性遗忘 |
1. 需要一定量的特定标注/弱标注/伪标注数据(尤其是SFT); 2. 需要一定的技术门槛(虽然QLoRA已经把门槛降得很低了,但还是需要懂Python、懂大模型、懂Hugging Face Transformers/PEFT等框架); 3. 微调需要一定的时间(虽然QLoRA微调一个7B参数的大模型只需要几小时,但微调一个70B参数的大模型还是需要几十小时甚至上百小时); 4. 泛化到完全不同的新场景的能力可能会有所下降(虽然PEFT能最大程度地保留泛化能力,但还是会有一点点下降) |
1. 需要长期、稳定、高质量地完成特定场景/特定规则的任务; 2. 需要深度提升Agent的核心闭环能力; 3. 需要记忆大量无法通过Context Window容纳的专属信息; 4. 需要严格遵循专属规则; 5. 需要减少幻觉、降低推理延迟、提升输出稳定性; 6. 有一定量的特定标注/弱标注/伪标注数据 |
| Prompt Engineering | 通过精心设计的提示词,引导Base LLM生成符合要求的输出 | 1. 第二层:通用自然语言理解与生成能力的局部优化; 2. 第三层:特定场景/特定规则的理解与遵循能力的局部、短期、灵活优化; 3. 第四层:单步工具调用理解与执行能力的局部优化; 4. 第五层:复杂多步闭环任务的核心能力的局部、演示级别的优化 |
1. 第一层:所有能力(除非用提示词引导Agent调用感知工具,但这不是Prompt Engineering本身的能力); 2. 第三层:特定场景/特定规则的理解与遵循能力的大规模、长期、稳定、高质量提升; 3. 第五层:复杂多步闭环任务的核心能力的大规模、长期、稳定、高质量提升; 4. 无法记忆大量无法通过Context Window容纳的专属信息; 5. 幻觉问题无法从根本上解决; 6. 推理成本高(因为需要把很多提示词和Few-Shot示例塞进Context Window) |
1. 不需要任何特定标注数据; 2. 技术门槛极低(几乎任何人都能写提示词,只是写得好不好的问题); 3. 快速迭代(修改提示词只需要几秒钟); 4. 灵活性极高(可以随时根据用户的需求修改提示词); 5. 完全不会灾难性遗忘 |
1. 能力提升局部、短期、不稳定、质量波动大; 2. 无法记忆大量无法通过Context Window容纳的专属信息; 3. 幻觉问题无法从根本上解决; 4. 推理成本高(因为需要把很多提示词和Few-Shot示例塞进Context Window); 5. 提示词写得不好会导致输出完全不符合要求; 6. 泛化到新的子任务的能力完全依赖提示词的设计 |
1. 需要短期、灵活、快速迭代地完成局部优化的任务; 2. 没有任何特定标注数据; 3. 技术门槛极低; 4. 需要演示级别的Agent原型; 5. 需要与Fine-tuning配合使用,作为Fine-tuning的补充 |
| RAG(检索增强生成) | 从长期记忆库中检索当前任务最需要的关键信息,塞进Context Window,引导Base LLM生成符合要求的输出 | 1. 第一层:长期记忆管理能力的检索和存储的辅助优化; 2. 第二层:通用自然语言理解与生成能力的局部优化(避免生成过时的、不存在的专属信息); 3. 第三层:特定场景的自然语言理解与生成能力的局部优化(辅助理解专业术语、专业逻辑); 4. 从根本上减少因“缺乏专属信息”导致的幻觉 |
1. 第一层:基础多模态感知能力、短期Context Window记忆能力、长期记忆库的存储容量; 2. 第三层:特定场景/特定规则的理解与遵循能力的大规模、长期、稳定、高质量提升; 3. 第四层:工具调用能力; 4. 第五层:复杂多步闭环任务的核心能力; 5. 无法减少因“逻辑推理错误”导致的幻觉; 6. 检索结果的质量直接影响输出的质量(如果检索结果不准确、不相关,输出的质量也会很差) |
1. 不需要任何特定标注数据(除非要优化检索模型,但这不是RAG本身的核心); 2. 技术门槛相对较低(有很多成熟的RAG框架,比如LangChain、LlamaIndex、Haystack等); 3. 从根本上减少因“缺乏专属信息”导致的幻觉; 4. 能动态更新专属信息(只需要更新长期记忆库,不需要微调模型); 5. 完全不会灾难性遗忘 |
1. 检索结果的质量直接影响输出的质量; 2. 需要高质量的长期记忆库(需要对专属信息做预处理、分块、向量化、索引等); 3. 推理成本高(因为需要把检索结果塞进Context Window); 4. 无法记忆大量非常复杂的、结构化的专属信息(比如企业的复杂业务流程规则,用RAG检索的话可能会检索到很多不相关的规则,而且很难理解规则之间的依赖关系); 5. 无法减少因“逻辑推理错误”导致的幻觉 |
1. 需要动态更新专属信息; 2. 需要从根本上减少因“缺乏专属信息”导致的幻觉; 3. 没有任何特定标注数据或者只有少量; 4. 需要与Fine-tuning、Prompt Engineering配合使用,作为Fine-tuning和Prompt Engineering的补充; 5. 专属信息是非结构化的、文本为主的、不需要严格遵循复杂依赖关系的 |
| 工具链优化 | 优化Agent可用的工具的功能、性能、接口、描述、使用限制等,让Agent更容易调用工具 | 1. 第四层:单步工具调用理解与执行能力的辅助优化; 2. 第五层:智能工具链调用能力的辅助优化; 3. 第一层:基础多模态感知能力的辅助优化(通过优化感知工具) |
1. 除了辅助优化的能力之外的所有Agent能力问题; 2. 工具本身的硬件限制(比如感知工具的分辨率限制) |
1. 技术门槛相对较低(如果是优化现有工具的接口、描述、使用限制的话); 2. 能直接提升工具调用的成功率和效率; 3. 能直接提升Agent的执行速度 |
1. 如果是开发新工具的话,技术门槛很高; 2. 无法解决Agent本身的能力问题(如果Agent本身的工具调用理解与执行能力很差,工具链优化得再好也没用) |
1. 现有工具的功能、性能、接口、描述、使用限制不够好; 2. 需要开发新的专属工具; 3. 需要与Fine-tuning、Prompt Engineering、RAG配合使用,作为补充 |
现在,我们再做一个概念联系的ER实体关系mermaid架构图(展示Fine-tuning、Prompt Engineering、RAG、工具链优化、Base LLM、Agent五层能力、外部环境、用户之间的实体关系):
更多推荐

所有评论(0)