温馨提示:若页面不能正常显示数学公式和代码,请阅读原文获得更好的阅读体验。

作者: 丁闪闪 (连享会)
邮箱: lianxhcn@163.com

系列说明:本文是「AI我知道」系列推文的第四篇,面向经管、金融、社会学领域的研究者和学生。我们的目标不是把你训练成 AI 工程师,而是帮你建立足够扎实的概念框架,让你能更聪明地使用这些工具,并在研究和工作中做出有依据的判断。

  • Title: AI我知道:AI 如何自己干活?Agent、工具调用与 MCP
  • Keywords: Agent, 工具调用, MCP, 工作流, Function calling, 大语言模型, ChatGPT

你经常听到这样的话:AI 不只是「会聊天」了,它开始「自己干活」了。听起来确实很诱人。你说一句需求,它就去搜资料、读文档、写代码、跑命令、整理结果,最后把一份像样的答案交回来。

可一旦真正上手,新的疑问很快就会冒出来:这到底算什么能力?它和普通的聊天式 AI 差别在哪里?为什么有时候它的确像一个会主动推进任务的助理,有时候却只是看起来很忙,做了不少动作,却没有真正抓住问题?

对普通用户来说,要理解「AI 开始自己干活」到底意味着什么,至少要先搞懂三个概念:Agent工具调用(Tool use / Function calling) 和 MCP(Model Context Protocol)。它们分别对应三层问题:

  • AI 怎样从“只会回答”走向“能够执行任务”;
  • 模型怎样接入搜索、代码、文件、数据库等外部工具;
  • 为什么越来越多的人开始把 MCP 看成连接工具和数据源的一种通用接口。

1. Agent:重点不在“更聪明”,而在“能推进任务”

1.1 什么叫 Agent?

很多人第一次听到「Agent」这个词,很容易把它理解成“更高级的大模型”。这种理解不能说完全不对,但还是偏了重点。

更准确一点说,Agent 不是某个单独的模型名,而是一种围绕任务组织起来的工作方式。

如果把普通聊天模型看成“你问一句,它答一句”的系统,那么 Agent 更像下面这样一套组合:

  • 先判断目标是什么;
  • 再把大任务拆成几步;
  • 按需要调用外部工具;
  • 根据工具返回的结果继续往下走;
  • 必要时调整步骤;
  • 最后整理成一个可交付的结果。

所以,Agent 的关键不在于“会不会说”,而在于能不能围绕一个目标持续推进工作。OpenAI 在官方的 Agents Cookbook 里,也把 agent 定义为一种代表用户完成任务的系统:它会使用模型来执行指令、做决策,并在明确边界内调用工具,去获取上下文或采取行动。把这句话换成更日常的说法,大概就是:它不只是回答问题,而是会在限定范围内,替你往前多走几步。

1.2 为什么它会让人觉得“像人在做事”?

因为和传统聊天式 AI 相比,Agent 多了三层很重要的特征。

  • 第一层,是目标感。你不只是让它“解释一个概念”,而是让它“整理一组材料”“比较三篇论文的识别策略”“找出某个项目里最相关的文件”。这类任务更像工作目标,而不是一次普通问答。

  • 第二层,是过程感。Agent 往往不会一口气直接吐出最终答案,它中间会经历检索、筛选、执行、观察、再整理几个环节。这和助研接到任务之后先翻资料、看文件、跑流程,再写结论,其实已经有点相似了。

  • 第三层,是行动感。普通聊天模型的活动范围,大多停留在输入框里;而一旦它能接触搜索、文件系统、终端、数据库、浏览器、代码沙箱,它就不只是“会说话”,而开始能够碰到任务相关的外部对象。这也是为什么很多人第一次用到这类系统时,会明显感觉它“不是单纯聊天了”。

不过,这里最好先压住一个常见误解:Agent 不是万能助理,更不是“放着就能放心托付”的自动员工。 在很多场景里,它仍然只是一个会分步调用工具、能做有限判断的系统。把它理解成“会做事的流程系统”,通常比把它想象成“全能副手”更稳妥。

1.3 Agent 和 Workflow 到底差在哪?

这一点很值得单独说清,因为现在很多产品都会把“自动化流程”也叫成 agent。

一个比较实用的区分是:

  • Workflow 更像事先设计好的流程图。步骤基本写死,遇到什么输入走什么分支,系统本身的自由裁量不多。
  • Agent 则更强调:系统会根据当前拿到的结果,决定下一步做什么。

这里并不是谁比谁高级,而是两种不同的设计思路。对普通用户来说,一个更朴素、也更有用的判断标准是:这个系统是在“按既定流程执行”,还是在“边看结果边决定后续动作”。很多真正可靠的产品,未必是那种看上去最“聪明”的 agent,反而可能只是把 workflow 设计得足够清楚。

图 1:Agent 更像“围绕目标做事”的系统

图 1:Agent 不是单独一个模型名,而是一套围绕目标推进任务的工作方式。它通常包含理解目标、拆分步骤、调用工具、观察结果和整理交付这几个环节。


2. 工具调用:模型开始“碰到任务本身”

2.1 什么是工具调用?

如果说 Agent 描述的是一种工作方式,那么「工具调用」就是这套工作方式真正落地的关键一环。

所谓工具调用,说得直白一点,就是模型在对话过程中,不只是继续生成一段文字,而是可以去调用一个外部能力。例如:

  • 搜索网页;
  • 读取本地文件;
  • 运行一段代码;
  • 访问数据库;
  • 调用某个 API;
  • 打开日历、邮件、表格、浏览器等应用。

过去几年里,OpenAI 这条产品线其实越来越清楚:从早期的 function calling,到后来的 tools、Responses API,再到 Agents SDK,核心都指向同一件事——模型不只是在“语言空间”里回答,它还可以借助工具去获取信息、执行动作、补足上下文。到了今天,工具已经不再是某种边缘能力,而是 agent 体系里的基础组成部分。

2.2 为什么工具调用会让体验明显变化?

因为一旦模型能调用工具,它的“作答基础”就变了。

以前你问一句:“帮我分析这份数据。”
如果模型并不能真正接触这份数据,它最多只能根据你贴进来的几行内容,给出一段大而化之的分析。

但如果它真的能读取文件、运行代码、搜索相关资料,再把这些结果拼起来,那么它给你的就不再只是“像答案的话”,而更像是基于外部对象做过一点工作之后的结果。这里最关键的变化,并不是模型突然更懂了,而是它开始有能力离开聊天框,接触任务本身。

这对科研和教学尤其重要。因为很多任务,原本就不是靠语言想象能够完成的,而必须接触具体对象:

  • 读 PDF,要能接触 PDF;
  • 查文献,要能接触检索源;
  • 跑代码,要能接触执行环境;
  • 处理表格,要能接触真实数据文件。

所以,工具调用并不是什么“锦上添花”的功能。对很多实际场景来说,它就是 AI 从问答走向工作流的分水岭。

2.3 为什么工具越多,系统不一定越好用?

因为工具会把系统的能力放大,也会把系统的失误一起放大。

一种常见问题,是工具选错了。本来应该先检索文件,它却急着下结论;本来应该先读文档,它却先跑去搜互联网;本来只需要跑一段简单代码,它却绕了一大圈,最后还没有抓住核心。这类问题,本质上是步骤判断出了偏差。

另一种问题,是工具虽然用对了,但结果没有接好。它确实找到了材料,却没抓住关键片段;它确实跑了代码,但在解释结果时又回到了自己的语言惯性;它确实读了文档,但总结时又混入了额外猜测。这类问题,本质上是执行结果没有被正确整合。

所以,工具调用本身并不自动等于可靠。它只是让系统有机会接触更真实的外部信息,至于这些信息能不能被妥当地吸收、转换、组织起来,依然是 agent 设计里最难啃的部分之一。

图 2:工具调用让模型从“会说”走向“会做”

图 2:工具调用的核心,不是让模型“动作更多”,而是让它能真正接触任务相关的外部对象,例如网页、文件、代码和数据库。体验变化的关键,就来自这里。


3. MCP:更像一种通用接口

3.1 MCP 到底是什么?

讲到这里,自然会碰到另一个问题:如果每个模型、每个工具、每个应用都要单独做对接,那是不是很快又会变成一堆彼此不兼容的小系统?

这正是 MCP 出现的背景。

MCP(Model Context Protocol),可以先把它理解成:一种让 AI 应用与外部系统建立连接的开放标准。MCP 官方文档和 Anthropic 的介绍页都用了一个非常形象的比喻:它像 AI 应用的 USB-C 接口。 这个比喻之所以好用,不是因为 MCP 本身包办了一切,而是因为它提供了一种统一的连接方式。只要应用和工具都按同一套协议说话,就不必为每一对“模型 × 工具”重新做一套私有对接。

所以,从概念上说,MCP 的重点不在于“让模型更聪明”,而在于让连接这件事更标准化、更可复用

3.2 为什么它值得关注?

因为它试图解决的是一个非常现实、也越来越明显的问题:AI 工具生态太碎。

如果没有统一协议,那么每接一个文件系统、一个数据库、一个搜索服务、一个应用界面,都可能要单独开发、单独维护。对普通用户来说,这意味着工具彼此割裂,迁移成本高;对开发者和平台来说,这意味着重复造轮子,扩展起来也很累。

MCP 想做的,是把这种关系变得更“可组合”。模型端实现一次客户端能力,工具端实现一次服务端能力,中间按同一套协议传递上下文、工具描述和调用结果。这样一来,新的工具、新的数据源、新的工作流,就更容易接入同一个生态。

从官方信息看,Anthropic 在 2024 年把 MCP 作为一种安全的双向连接标准提出来;到了 2026 年,MCP 路线图已经在讨论 transport scalability、agent communication、governance maturation 和 enterprise readiness 等议题。这至少说明一件事:MCP 不再只是一个新鲜概念,而是在往更完整的生态基础设施方向发展。

温馨提示:若页面不能正常显示数学公式和代码,请阅读原文获得更好的阅读体验。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐