开源Agent框架全景研究:13个框架如何选型?

引言

2023年,一个AI Agent能调用工具就算“先进”;2024年,多Agent协作成为标配;到了2026年Q3,Agent框架的竞争维度早已从“能不能做”升级为“能不能在生产环境稳定运行”——长任务可恢复、状态可审计、权限可收放、成本可预测,缺一不可。

本文基于最新开源社区数据,对13个主流Agent框架进行系统梳理,涵盖编排范式、核心定位、选型场景,帮助技术团队建立清晰的选型决策框架。

一、Agent框架的本质:包装同一套“模型—工具—反馈”循环

无论框架名称如何变化——Agent、Assistant、Crew还是Workflow——大多数框架都在包装同一套核心流程:

步骤 功能 说明
01 任务/指令 目标、人设、规则与输出契约
02 模型判断 理解上下文,决定回答或行动
03 工具执行 搜索、数据库、代码、业务API
04 观察反馈 把结果送回模型,继续或纠错
05 状态/记忆 保留会话、进度、用户与知识
06 治理/评测 追踪、权限、审批、成本与质量

真正拉开框架差距的,不是能不能调用工具,而是状态能否恢复、流程能否控制、错误能否看见、权限能否收住。 模型决定智商上限,框架决定系统下限。

二、编排范式分类:决定“下一步”的六种方式

Agent编排的核心不是“有几个Agent”,而是谁决定下一步、如何回头、什么时候停

范式 控制者 特点 代表框架
自由循环 模型 + 边界 模型决定工具、下一步与交卷时机;代码主要设边界 OpenAI SDK、PydanticAI、Hermes、Letta
状态图 State + Node + Edge 宏观路径和状态转移显式,适合高失败成本与跨日任务 LangGraph、MAF、Spring AI Alibaba
工作流 Step + 业务规则 步骤、输入输出、触发器、重试和SLA Mastra、LlamaIndex Workflows、CrewAI Flows
角色协作 Manager + 角色关系 用角色、任务、委派、评审和Handoff描述协作拓扑 CrewAI、AutoGen、MAF、Agno Teams
图工作流 图引擎 + 动态路径 结合图与工作流的动态执行,Python/TS/Go/Java全覆盖 Google ADK 2.0
平台运行 Runtime + Policy 部署、会话、身份、权限、密钥、队列、调度、观测、多租户 Agno AgentOS、Letta Server

最容易混淆的一组: 工作流强调“任务和步骤的生命周期”,状态图强调“状态及其转移关系”。工作流可以用图实现,图也可以表达工作流——选型时应看团队更希望围绕Step还是State思考。

三、13个框架核心定位

S档——综合主战场

框架 核心定位 语言 社区热度 生产成熟度
LangGraph 状态图持久执行,支持长流程恢复与HITL Python/TS 37.7K⭐ ⭐⭐⭐⭐⭐
OpenAI Agents SDK 轻量原语+Handoff+Guardrails+Tracing Python/TS 27.1K⭐ ⭐⭐⭐⭐⭐
Google ADK 多语言+图工作流+A2A+Vertex部署 4语言 20.8K⭐ ⭐⭐⭐⭐

在这里插入图片描述

A档——各有绝活

框架 核心定位 语言 社区热度
PydanticAI 类型安全+结构化输出+依赖注入 Python 18.6K⭐
LlamaIndex 文档解析+RAG+数据Agent护城河 Python/TS 51K⭐
Microsoft Agent Framework AutoGen+Semantic Kernel统一 .NET/Python 12.2K⭐

在这里插入图片描述

B档——选对主场很能打

框架 核心定位 语言 社区热度
Mastra TypeScript全栈Agent+Workflow TypeScript 26.3K⭐
CrewAI 角色化协作+Flow管控 Python 55.8K⭐
Agno AgentOS平台脚手架 Python 40.4K⭐

C档——偏科高手

框架 核心定位 语言 社区热度
**Spring AI Alibaba
** Java/Spring+阿里云主场 Java 10.4K⭐
Letta 长期记忆独门绝技 Python/TS 23K⭐
Hermes Agent 自托管数字同事 Python 217K⭐

在这里插入图片描述

D档——新项目慎选

框架 核心定位 状态
AutoGen 对话驱动多Agent经典范式 官方维护模式,新项目转MAF

四、编排范式演进:从单一模式到组合调度

同题演示:一笔退款申请,换一种范式就换一种“组织语言”

范式 实现方式
自由循环 把退款目标、订单工具、政策检索和资金工具交给Agent;它自行决定先查什么、何时追问、何时提交结果
状态图 ENTRY→查订单→验政策→条件边:自动退款/人工审批/拒绝→END,每一步状态可检查点恢复
工作流 退款事件触发;订单校验和风险检查并行;汇聚后按金额路由;失败重试,超时进入人工队列
角色协作 客服Agent收集情况,政策Agent判断条款,风控Agent审核风险,Manager汇总并验收最终决定
平台运行 渠道消息进入Runtime,加载用户、租户和Session,执行任一内部编排,记录Trace并持久化结果

生产系统通常不是五选一,而是分层组合: 平台负责活着,图和工作流负责别乱跑,角色负责分工,自由循环负责处理那些没人提前想明白的问题。

五、选型决策框架

选型之前,先回答三个问题:

① 失败能不能重来?

  • 不能 → 优先显式图、检查点、审批和幂等设计,先看LangGraph/MAF
  • 能 → 轻量SDK或角色协作框架足够

② 难点到底在哪?

  • 文档检索 → LlamaIndex
  • 类型和结构 → PydanticAI
  • 长期记忆 → Letta
  • 多端平台 → Agno

③ 团队会什么?

  • Python → LangGraph、PydanticAI、CrewAI
  • TypeScript → Mastra、OpenAI SDK
  • Java/Spring → Spring AI Alibaba
  • .NET → Microsoft Agent Framework

六、生产落地的共同规律

从各框架的公开案例中可以总结出几条共性规律:

  1. 自治与审查并存:所有生产级Agent系统都在关键节点嵌入人工审批(HITL)或规则校验
  2. 先测检索,再谈Agent:RAG类Agent的成功率高度依赖检索质量,LlamaIndex等框架的价值在于先把数据地基打牢
  3. 从问题出发选框架:不是“哪个框架最好”,而是先把业务题目念完——例如需要长期记忆的选Letta,需要Java企业集成的选Spring AI Alibaba
  4. 降低Token成本是必修课:Google ADK等框架内置的上下文工程能力,正在成为生产级选型的硬性指标

七、结语

Agent框架的竞争已经从“功能数量”转向了 “生产环境的确定性” 。一个框架的真正价值,不在于演示时能完成多复杂的任务,而在于任务失败时能否恢复、状态变化时能否审计、成本失控时能否刹车。

选型不是问“谁最火”,而是问你的擂台、兵器和失败代价是什么。 八个不会干活的Agent,只是把无效会议搬进了token账单。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐