16个AI术语扫盲(四):Agent、多模态、Planning——AI的「手脚」与「眼睛」

约 3,500 字 | 预计阅读 13 分钟 | 系列第 4/5 篇


创业公司 CTO 大刘给他的 AI Agent 接入了 Jira API,设定了一条规则:「当用户反馈中出现 ‘bug’ 和 ‘crash’ 时,自动创建 Critical 级别的 Bug Ticket。」

第一周一切完美。第二周的周一早上,大刘打开 Jira,看到了 247 个 Critical Bug Ticket。因为某个用户在论坛里发了一篇帖子,标题是:「My Top 10 Favorite Software Bugs and Crashes of All Time」。

Agent 完美执行了它的指令。但它不知道什么是「语境」——它把「Favorite Bug」当成了 Bug Report。

这就是 Agent 和 Chatbot 的本质区别——Agent 不仅回答问题,它做事。而一旦 AI 开始做事,错误就不再是「回答不对」,而是「做了不该做的事」。

读这篇文章你会得到:

  • Agent 的核心能力不是「调用工具」——是「在不确定的环境中做多步决策」
  • 多模态不是炫技——它解决的是 LLM 最大的盲区:世界不只是文字
  • ReAct、Planning、Reflection——这些名词背后其实是同一个问题的不同解法

目录

  1. AI Agent:当 LLM 开始「做事」
  2. Agent 的核心能力清单
  3. ReAct、Planning、Reflection:Agent 的三种思考方式
  4. Multi-Agent System:一群 Agent 怎么协作
  5. Multi-modal:让 AI 拥有「五感」
  6. 文生图、文生视频、语音——多模态的四大战场
  7. 术语速查表
  8. FAQ
  9. 结语

1. AI Agent:当 LLM 开始「做事」 {#1}

AI Agent(AI 智能体) 是一个能自主感知环境、做出决策、执行行动以实现目标的 AI 系统。

Agent 和 Chatbot 的核心区别:

维度 Chatbot Agent
输出 文本 行动(API 调用、文件操作、邮件发送……)
交互模式 一问一答 多步执行 + 反馈循环
状态 无状态(每轮独立) 有状态(维护任务进度)
错误处理 说错了下一轮纠正 做错了可能产生真实后果
时间跨度 秒级 分钟到小时甚至天级

为什么 2024-2025 年 Agent 突然爆火? 不是因为技术突破——Function Calling 2023 年就有了。是因为 LLM 的推理能力跨过了一个临界点:模型不仅能「回答单轮问题」,还能在 10-20 步的多步任务中保持连贯的意图。Agent 的瓶颈从来不是「能不能调 API」——是「能不能在连续调用 18 个 API 之后,还记得最开始要干什么」。

Autonomous Agent(自主智能体) 更进一步:不需要人类在每一步确认,Agent 自己决定下一步做什么。AutoGPT、BabyAGI 是早期代表。自主性的代价是风险——大刘的 247 个 Bug Ticket 就是教训。


2. Agent 的核心能力清单 {#2}

一个合格的 AI Agent 需要哪些能力?业界正在收敛到以下清单:

Tool Use / Function Calling(工具使用)

这是 Agent 的手——调用外部 API、数据库、文件系统。第二篇讲过 Function Calling 的机制。在 Agent 语境下,关键是 工具的数量和复杂度——一个 Agent 可能同时有 10-20 个可用工具,需要判断「什么时候用哪个、参数填什么、多个工具按什么顺序调用」。

Memory(记忆)

Agent 需要记住三件事——

  • 短期记忆:当前任务的进度、上一步的结果(存在 Context Window 里)
  • 长期记忆:跨对话的信息——用户偏好、历史决策(存在外部数据库,检索后注入 Context)
  • 工作记忆:当前正在处理的信息块(类似人类的「暂存器」)

记忆不是 Context Window 的替代品——它是 Context Window 的延伸。 没有任何 Context Window 能装下你和 Agent 过去三个月的所有对话。Memory 让你只把「相关的历史」注入 Context。

Planning(规划)

给定一个复杂目标,Agent 将其分解为可执行的子任务序列。「帮我做一个竞品分析报告」→ ① 搜索竞品列表 → ② 逐个收集产品信息 → ③ 对比功能矩阵 → ④ 生成 SWOT 分析 → ⑤ 输出报告。

Planning 的核心挑战:计划在第一步就可能出错。 当第三步发现缺少某个关键数据时,Agent 需要回到第一步补充搜索。这叫 Re-planning(重新规划)。

Reflection(反思)

Agent 在每一步执行后评估结果:「这一步的结果对吗?是否需要重试?是否需要换一种方法?」

Reflection 是当前 Agent 最重要的安全机制之一。 一个没有 Reflection 的 Agent 会把第一步的错误一路带到最后一步——247 个 Bug Ticket 就是没有反思的结果。

Grounding(根基化/落地)

Grounding 是让 Agent 的行为「基于现实」——不凭空产生 URL、不编造 API 调用参数、不虚构数据库查询结果。在实践中,Grounding 通常意味着:Agent 的输出必须能追溯到具体的检索结果或工具返回——如果不能,就重试或寻求人类确认。


3. ReAct、Planning、Reflection:Agent 的三种思考方式 {#3}

ReAct(Reasoning + Acting,推理与行动交替)

ReAct 是 Google 在 2022 年提出的一个经典框架。核心思想:Agent 不应该「先想完所有步骤再执行」——应该「想一步,做一步,根据结果再想下一步」。

模式:Thought → Action → Observation → Thought → Action → Observation → …

比如「北京今天适合户外运动吗?」

  • Thought:我需要知道天气
  • Action:调用天气 API(北京)
  • Observation:晴,25°C,微风
  • Thought:还需要知道空气质量
  • Action:调用空气质量 API(北京)
  • Observation:AQI 45,优
  • Thought:天气好,空气好——适合
  • 最终回答:适合户外运动

ReAct 的优势: 每一步基于真实反馈调整——不会一条道跑到黑。它是目前生产级 Agent 最常用的推理框架。

Planning vs ReAct

Planning 是「先全局规划、再逐步执行」;ReAct 是「边想边做」。前者适合目标明确、步骤可预测的任务(报告生成、代码部署);后者适合探索性强、信息不完整的任务(调研、排错)。

2025 年的共识:不是二选一,而是组合。 Plan-and-Execute 模式——先做一个粗粒度的全局规划(Plan),每一步执行时用 ReAct 处理不确定性。


4. Multi-Agent System:一群 Agent 怎么协作 {#4}

Multi-Agent System(多智能体系统) 是由多个 Agent 协作完成复杂任务的系统。每个 Agent 有特定的角色和能力,它们之间通过通信和协调来完成单个 Agent 无法完成的任务。

为什么需要多个 Agent? 两个原因——① 单个 LLM 的 Context Window 是有限的,复杂任务拆分到多个 Agent 可以并行处理;② 不同的子任务需要不同的「专业能力」——一个 Agent 擅长代码生成,另一个擅长代码审查,两者互相校验。

典型模式:

  • 顺序流水线:Agent A 输出 → Agent B 输入 → Agent C 输入(比如:写代码 → 审查代码 → 生成文档)
  • 辩论/对抗:Agent A 提出方案,Agent B 批判和找漏洞,Agent A 修改——反复迭代直到收敛
  • 层级调度:一个 Supervisor Agent 将任务分配给多个 Worker Agent,汇总结果

Multi-Agent 的当前边界: 听起来很强,但实际上——超过 5 个 Agent 的系统,错误率会指数级上升。 每个 Agent 的错误会传递给下一个,形成级联效应。2025 年的最佳实践:Agent 数量宁少毋多,交互协议越简单越可靠。


5. Multi-modal:让 AI 拥有「五感」 {#5}

Multi-modal(多模态) 是指 AI 系统能同时理解和处理多种类型的信息——文本、图像、音频、视频。

为什么出现? 世界不是纯文本的。一个纯文本 LLM 看不到你的产品截图,听不懂你的语音消息,无法分析一段监控录像。多模态填补了这个根本性的盲区。

VLM(Vision Language Model,视觉语言模型) 是目前多模态最核心的落地形态——能同时「看懂」图片和「读懂」文字。GPT-4V、Gemini 1.5 Pro、Claude 3.5 Sonnet 都具备视觉能力。

核心架构思路: 把图像「翻译」成 LLM 能理解的格式。做法——用一个视觉编码器(Vision Encoder)把图像转成 Embedding 向量,然后和文本 Token 一起送入 LLM。图像不是单独处理的——它和文本在同一个 Embedding 空间里「聊天」。

多模态不是给 AI 加上眼睛和耳朵——是让它终于活在和人类一样的感知世界里。纯文本 AI 看到的是一个符号系统;多模态 AI 看到的是整个世界。这两者之间的差距,比你觉得的更大。


6. 文生图、文生语音、视频——多模态的四大战场 {#6}

文生图(Text-to-Image Generation)

输入文本描述,输出图像。代表模型:DALL·E 3、Midjourney、Stable Diffusion。核心原理是 Diffusion Model(扩散模型)——从随机噪声开始,逐步「去噪」成一张符合描述的清晰图像。

与 LLM 的关系: 这是两种完全不同的技术路线。LLM 基于 Transformer + 自回归预测,Diffusion 基于逐步去噪。两者目前是「协作」而非「融合」——DALL·E 3 用 GPT-4 优化 Prompt,再用 Diffusion 生成图像。

文生视频(Text-to-Video Generation)

输入文本描述,输出视频片段。代表:Sora(OpenAI)、Runway Gen-3。2024 年是文生视频的元年——Sora 展示了物理世界模拟的可能性。

核心挑战: 视频 = 时间序列上的图像。不仅要保证每一帧好看,还要保证帧与帧之间物理上一致——物体不会突然消失,光影不会跳跃。这是 Diffision Model 在 3D(空间 + 时间)上的延伸。

语音识别(ASR / STT)

ASR(Automatic Speech Recognition,自动语音识别) 也叫 STT(Speech-to-Text,语音转文字)——把语音转为文字。Whisper(OpenAI)是目前最主流的开源方案。

为什么属于多模态范畴? 语音是另一种信息模态。现代 ASR 模型(如 Whisper)基于和 LLM 类似的 Transformer 架构——本质上是把「音频信号 Embedding」翻译成「文字 Token」。

语音合成(TTS)

TTS(Text-to-Speech,文字转语音)——把文字转为自然语音。ChatGPT 的语音对话模式、ElevenLabs 的 AI 配音都是 TTS。最前沿的方向是 Zero-shot Voice Cloning(零样本声音克隆):给 3 秒的语音样本,生成该声音说任何内容。


7. 术语速查表 {#7}

缩写/术语 英文全称 中文 本质一句话
AI Agent AI 智能体 能自主感知、决策、执行多步行动的 AI 系统
Tool Use 工具使用 Agent 调用外部 API 和服务的能力
Memory 记忆 Agent 跨时间和对话保持信息的能力
Planning 规划 将复杂目标分解为可执行子任务序列
Reflection 反思 Agent 在执行后评估结果并调整策略
Grounding 根基化 让 Agent 的输出基于真实来源而非凭空编造
ReAct 推理与行动交替 想一步→做一步→看结果→调整的 Agent 推理框架
Autonomous Agent 自主智能体 无需人类逐步确认、自主决策的 Agent
Multi-Agent System 多智能体系统 多个 Agent 通过协作完成复杂任务
Multi-modal 多模态 AI 同时理解和处理文本、图像、音频、视频
VLM Vision Language Model 视觉语言模型 能同时理解图像和文本的模型
ASR / STT Automatic Speech Recognition / Speech-to-Text 自动语音识别 / 语音转文字 将语音信号转为文本
TTS Text-to-Speech 文字转语音 将文本合成为自然语音
Diffusion Model 扩散模型 从随机噪声逐步去噪生成图像的模型
Text-to-Image 文生图 根据文本描述生成图像
Text-to-Video 文生视频 根据文本描述生成视频

8. FAQ {#8}

Agent 和 Function Calling 到底什么关系?

Function Calling 是 Agent 的一个子能力——Agent 的手。 但 Agent 还包括 Planning(知道先调用哪个)、Memory(记住上次调用的结果)、Reflection(调用失败后换一种方式)和 Grounding(不编造参数)。一个只有 Function Calling 的系统是「工具调用器」,不是 Agent。

现在(2025年)Agent 可靠到可以无人值守了吗?

不可以。 当前的 Agent 在做 3-5 步的简单任务时可靠度约 85-95%。步数越多,可靠度指数级下降——15 步任务的端到端成功率通常不到 50%。最佳实践:高危操作(付款、删除、发送)必须走人类确认流程。

多模态模型能替代纯文本 LLM 吗?

不能也不应该。 多模态模型更强——但更贵、更慢、Context Window 中图像占用的 Token 量远超文本。如果任务不需要图像理解(如文本摘要、代码生成),用纯文本模型更高效。按需选择——不要因为有了瑞士军刀就不用螺丝刀。

语音 AI(ASR + TTS)和 LLM 是什么关系?

协作关系。 ASR 把你说的语音转成文字 → LLM 处理文字生成回复 → TTS 把回复转成语音。ChatGPT Voice Mode 就是这条管道。但实时语音对话还需要解决一个额外问题:什么时候该开始说、什么时候该停——这不是 TTS 的问题,是对话节奏管理的问题。

Multi-Agent 适合什么场景,不适合什么场景?

适合: 需要多种专业能力协作的任务(写代码 + 审查 + 写文档)、需要对抗校验的任务(方案 + 批判 + 迭代)。不适合: 简单任务——多加 Agent 就是多加失败点。法则:能用 1 个 Agent 解决的,绝不用 3 个。

文生视频什么时候能实用化?

2025 年仍处于「惊艳但不实用」的阶段。 单次生成时间长(分钟级)、物理一致性不稳定、可控性有限。但进步极快——从 Sora(2024.2)到 Sora Turbo(2024.12),速度和可控性都有数量级提升。2026 年可能是文生视频的实用化元年。


9. 结语 {#9}

大刘后来给 Agent 加了两道防线——第一道,Reflection:「在创建 Bug Ticket 之前,确认这条反馈确实报告了一个具体的、可复现的技术问题。」第二道,人类确认:「批量创建 5 个以上的 Ticket 需要管理员审批。」

247 个误报的故事没有重演。

Agent 的方向是对的——让 AI 从「说」走向「做」。但「做」意味着责任,意味着对错误的代价有了真实的体感。每一条 Agent 之路都有一个 Jira 填满误报的周一早晨——关键是,你给它上了什么保险丝。

下一篇是系列的终章:让 AI 跑起来的技术——GPU、CUDA、分布式训练、模型部署。 你写的 Prompt 再精妙、Fine-tuning 的参数再合理、Agent 的规划再周全——如果推理一次要等 30 秒,用户早就跑了。


📬 下一篇预告:《AI 术语扫盲(五):GPU、分布式训练、推理优化——AI 从「跑得动」到「跑得快」》

你给 AI Agent 开过最大胆的权限是什么?后果如何?评论区等你翻车故事。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐