最近,Anthropic 公司的 Alex Albert(Claude 关系负责人)与 Eric Schluntz(多智能体研究负责人)进行了一场深入的访谈,探讨了 AI 智能体(Agent)技术的最新发展,特别是 Claude 在多智能体系统、代理任务能力以及开发者工具方面的突破。这场访谈不仅为我们揭示了 Claude 如何通过强化学习进化为强大的智能体,更提供了构建复杂、高效 AI 系统的深刻洞察和最佳实践。

一、Claude 成为高效智能体的基础:训练与编码能力

Anthropic 成功将 Claude 塑造成高效智能体,主要归功于其独特的训练方式。

强化学习与长期任务实践: 在训练过程中,Anthropic 让 Claude 练习扮演智能体。它需要处理开放式问题,并执行多步骤任务,使用工具,并探索其所处的环境,最后才给出最终答案。正是通过在不同环境(如编码任务和搜索任务)中的大量强化学习(RL)实践,Claude 学会了如何在有限指导或反馈下完成这些任务。

编码是智能体的“基本功”: Eric 认为,虽然 Claude 在代码方面表现惊人,但这并非终点。Anthropic 专注于将编码能力作为智能体的核心基础技能。一旦拥有了强大的编码代理,它就能胜任任何其他工作。例如,需要执行搜索任务时,它可以编写代码通过 API 进行网络搜索;需要规划周末时,它可以创建日程安排。因此,编码被视为一种具有强大溢出效应的基本技能,能让 Claude 在各种任务中表现出色。

二、赋能智能体:从文件创建到“技能注入”

为了让 Claude 更具自主性,Anthropic 引入了多种机制,使其能够执行传统上非代码相关的任务。

1. 代码生成与行动力提升

Claude 能够通过编写代码来创造实际的产物。这包括编写 Python 脚本来生成 Excel 表格,或者通过编写 SVG 来创建图表或示意图。对于需要大量重复细节的复杂图表,让 Claude 编写代码来生成 SVG 文件的速度,远超让 Claude 直接生成文件本身。代码允许实现“加速”,例如利用“For Loop”(循环)执行重复操作,这是人类通过鼠标点击和拖拽无法比拟的效率提升。

2. Claude Code SDK:通用代理的核心框架

Claude Code SDK 是 Anthropic 鼓励开发者使用的核心工具。尽管名为 Code SDK,但它本质上是一个通用智能体,主要用于构建代理。

在此之前,开发者需要从零开始构建代理循环(Agent Loop),包括构建工具、执行工具、文件交互等。现在,SDK 将这些核心功能封装起来,避免开发者重复造轮子。开发者可以在此基础上,通过 MCP (Model Control Protocol) 添加针对自身业务逻辑的定制工具和功能。Claude Code SDK 甚至可以用于完全非代码相关的任务,比如通过网络搜索来规划约会

3. Skills:一键掌握新能力

Claude Skills(技能)是 Claude MD 文件的激动人心的扩展。它超越了单纯的指令文件,允许开发者提供各种类型的资源供智能体使用,包括 PowerPoint 模板、辅助脚本、图像或资产(Assets)等。

这种机制类似于电影《黑客帝国》中 Neo 被瞬间注入功夫的场景。通过 Skills,你可以将复杂的知识和工具一次性提供给 Claude,使其迅速“变身”。例如,你可以给它一个“如何创建电子表格”的技能,Claude 就能立即像一个“银行家”那样为你创建财务模型。这种方式让 Claude 拥有了完成任务所需的一切资源。

三、智能体架构的演进:走向协作与闭环

在过去几个月里,智能体系统的架构经历了显著的演变,从简单的工作流发展为复杂的协作模式。

1. 从工作流到“代理工作流”

过去的应用可能依赖于传统工作流,即一系列预先定义的提示链。然而,由于 Claude 在接收反馈和修正工作方面的能力大幅提升,如今的智能体循环(Agent Loops)在追求绝对质量时,性能已远远超越传统工作流。

新的趋势是**“代理工作流”(Workflows of Agents)。在这种模式下,传统工作流中的每一个步骤都变成一个闭环智能体**。例如,一个写 SQL 命令的步骤,不再是单次尝试,而是一个闭环:Claude 编写查询,运行,查看输出,然后迭代和重复,直到确定获得了正确的值,才过渡到工作流的下一步。这种模式克服了传统工作流中一步失败导致后续步骤完全崩溃的问题。

2. 可观测性与架构的简化原则

随着系统复杂性的增加,**可观测性(Observability)验证(Verification)**成为了巨大的挑战。Eric 强调,尽管模型功能强大,但在构建复杂系统时,简单性仍然至关重要

开发者应**“由简入繁”**:首先尝试单次提示(Single-Shot),或使用简单的 Claude Code SDK,只在绝对需要时才增加复杂性层级,否则会大大增加系统的观测难度。

四、多智能体系统:并行、协作与管理之道

多智能体(Multi-Agent)系统是 Eric 当前的主要研究领域,它代表了更高级的协作模式。

1. 多智能体 vs. 代理工作流

  • 代理工作流:一个智能体完成任务后,将其输出传递给下一个智能体接手工作(串行)。
  • 多智能体:多个智能体或多个 Claude 同时工作(并行)。例如,一个父代理可以将任务委托给五个子代理,让它们并行工作。

2. 核心设计模式与优势

  • 加速与并行化: Anthropic 的深度研究搜索产品就是通过一个主编排(Orchestrator)智能体创建多个子代理进行并行搜索,从而更快地返回结果。多智能体非常适合于任何可以并行化或进行 Map-Reduce 处理的任务。
  • 上下文保留(Context Preservation): 当某个子任务(如寻找类的特定实现)需要消耗成千上万的 Token 时,主模型可以将这项工作委托给一个子代理。子代理完成工作后,只需将最终的小答案返回给主上下文,从而保护主上下文不被冗余信息淹没
  • 测试时计算(Test Time Compute): 允许多个 Claude 同时解决一个问题,就像“集思广益”一样,往往能得到比单个智能体更好的最终答案。
  • 工具集划分: 对于拥有大量工具(如上百个)的客户,将这些工具分散给不同的子代理管理是一种有效策略。主代理只需要知道调用哪个“工具包”,而每个子代理只需要理解并使用其负责的约 20 个工具,从而降低了单个智能体需要理解的复杂性。

3. 工具调用与“新晋管理者”的挑战

对于 Claude 而言,子代理(Subagent)表现为一种工具(Tool)。主代理通过 Tool Calling 机制将 Prompt 作为参数传递给子代理。

在训练过程中,研究人员发现 Claude 在管理子代理时,会犯下**“初次管理者”的常见错误。例如,它可能会给出不完整或不清晰的指令,并期望子代理拥有正确的上下文,而实际上子代理并不知道全局背景。因此,训练的重点是让 Claude 变得更加冗长和详细**,向子代理提供任务的整体上下文,确保它们能更好地完成工作。

失败模式警示: 尽管多智能体系统功能强大,但如果过度构建,可能会导致智能体之间花费太多时间进行沟通,而非实际推进任务,产生大量的“沟通开销”和“死重”,从而损失效率。

五、开发者最佳实践与未来展望

Eric 为开发者提供了以下关键建议,以确保构建高效的智能体系统:

  1. 从简单开始: 仅在需要时才增加复杂性。
  2. 换位思考(Context Engineering): 站在 Claude 的角度,阅读模型实际接收到的原始转录、日志和工具调用信息。确保给模型提供足够的信息来解决问题。
  3. 工具设计应面向 UI,而非 API: 这是一个非常重要的原则。智能体是工具的“用户”,因此 MCP 或工具应该与用户界面(UI)而不是底层 API 一一对应。如果一个 API 有三个端点来获取 Slack 对话、用户名和频道名,给模型提供这三个独立的工具,它将不得不进行三次工具调用。理想情况下,开发者应该创建一个工具或 MCP,像 UI 一样一次性呈现所有信息,以减少模型的交互次数。

对未来的预测 (未来 6 至 12 个月):

Eric 预测,智能体将在未来变得更加普及,首先从可验证的领域开始,如软件工程。

最令人兴奋的趋势是**“闭环测试”——智能体将能够验证自己的工作**。例如,一个编码智能体在编写完 Web 应用后,可以实际打开、测试它,并发现和修复自己的 Bug,从而不再需要人类充当 Claude 的 QA 工程师。

此外,计算机使用能力(Computer Use)也将开辟新领域。如果 Claude 拥有操作计算机的能力,它就可以直接在 Google Docs 中滚动、点击和编辑文本来“清理文档”,而无需用户进行痛苦的复制粘贴。未来的愿景是,无论用户在哪里,Claude 都能通过这种能力伴随左右。


原始视频:https://youtu.be/uhJJgc-0iTQ?si=drTBgQxcCzl_G2eT

中英文字幕:

Claude构建更高效 AI 智能体的前沿实践与多智能体系统探索

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐