开源Agent框架全景研究:13个框架如何选型?
开源Agent框架全景研究:13个框架如何选型?
引言
2023年,一个AI Agent能调用工具就算“先进”;2024年,多Agent协作成为标配;到了2026年Q3,Agent框架的竞争维度早已从“能不能做”升级为“能不能在生产环境稳定运行”——长任务可恢复、状态可审计、权限可收放、成本可预测,缺一不可。
本文基于最新开源社区数据,对13个主流Agent框架进行系统梳理,涵盖编排范式、核心定位、选型场景,帮助技术团队建立清晰的选型决策框架。
一、Agent框架的本质:包装同一套“模型—工具—反馈”循环
无论框架名称如何变化——Agent、Assistant、Crew还是Workflow——大多数框架都在包装同一套核心流程:
| 步骤 | 功能 | 说明 |
|---|---|---|
| 01 | 任务/指令 | 目标、人设、规则与输出契约 |
| 02 | 模型判断 | 理解上下文,决定回答或行动 |
| 03 | 工具执行 | 搜索、数据库、代码、业务API |
| 04 | 观察反馈 | 把结果送回模型,继续或纠错 |
| 05 | 状态/记忆 | 保留会话、进度、用户与知识 |
| 06 | 治理/评测 | 追踪、权限、审批、成本与质量 |
真正拉开框架差距的,不是能不能调用工具,而是状态能否恢复、流程能否控制、错误能否看见、权限能否收住。 模型决定智商上限,框架决定系统下限。
二、编排范式分类:决定“下一步”的六种方式
Agent编排的核心不是“有几个Agent”,而是谁决定下一步、如何回头、什么时候停。
| 范式 | 控制者 | 特点 | 代表框架 |
|---|---|---|---|
| 自由循环 | 模型 + 边界 | 模型决定工具、下一步与交卷时机;代码主要设边界 | OpenAI SDK、PydanticAI、Hermes、Letta |
| 状态图 | State + Node + Edge | 宏观路径和状态转移显式,适合高失败成本与跨日任务 | LangGraph、MAF、Spring AI Alibaba |
| 工作流 | Step + 业务规则 | 步骤、输入输出、触发器、重试和SLA | Mastra、LlamaIndex Workflows、CrewAI Flows |
| 角色协作 | Manager + 角色关系 | 用角色、任务、委派、评审和Handoff描述协作拓扑 | CrewAI、AutoGen、MAF、Agno Teams |
| 图工作流 | 图引擎 + 动态路径 | 结合图与工作流的动态执行,Python/TS/Go/Java全覆盖 | Google ADK 2.0 |
| 平台运行 | Runtime + Policy | 部署、会话、身份、权限、密钥、队列、调度、观测、多租户 | Agno AgentOS、Letta Server |
最容易混淆的一组: 工作流强调“任务和步骤的生命周期”,状态图强调“状态及其转移关系”。工作流可以用图实现,图也可以表达工作流——选型时应看团队更希望围绕Step还是State思考。
三、13个框架核心定位
S档——综合主战场
| 框架 | 核心定位 | 语言 | 社区热度 | 生产成熟度 |
|---|---|---|---|---|
| LangGraph | 状态图持久执行,支持长流程恢复与HITL | Python/TS | 37.7K⭐ | ⭐⭐⭐⭐⭐ |
| OpenAI Agents SDK | 轻量原语+Handoff+Guardrails+Tracing | Python/TS | 27.1K⭐ | ⭐⭐⭐⭐⭐ |
| Google ADK | 多语言+图工作流+A2A+Vertex部署 | 4语言 | 20.8K⭐ | ⭐⭐⭐⭐ |

A档——各有绝活
| 框架 | 核心定位 | 语言 | 社区热度 |
|---|---|---|---|
| PydanticAI | 类型安全+结构化输出+依赖注入 | Python | 18.6K⭐ |
| LlamaIndex | 文档解析+RAG+数据Agent护城河 | Python/TS | 51K⭐ |
| Microsoft Agent Framework | AutoGen+Semantic Kernel统一 | .NET/Python | 12.2K⭐ |

B档——选对主场很能打
| 框架 | 核心定位 | 语言 | 社区热度 |
|---|---|---|---|
| Mastra | TypeScript全栈Agent+Workflow | TypeScript | 26.3K⭐ |
| CrewAI | 角色化协作+Flow管控 | Python | 55.8K⭐ |
| Agno | AgentOS平台脚手架 | Python | 40.4K⭐ |
C档——偏科高手
| 框架 | 核心定位 | 语言 | 社区热度 |
|---|---|---|---|
**![]() |
|||
| ** | Java/Spring+阿里云主场 | Java | 10.4K⭐ |
| Letta | 长期记忆独门绝技 | Python/TS | 23K⭐ |
| Hermes Agent | 自托管数字同事 | Python | 217K⭐ |

D档——新项目慎选
| 框架 | 核心定位 | 状态 |
|---|---|---|
| AutoGen | 对话驱动多Agent经典范式 | 官方维护模式,新项目转MAF |
四、编排范式演进:从单一模式到组合调度
同题演示:一笔退款申请,换一种范式就换一种“组织语言”
| 范式 | 实现方式 |
|---|---|
| 自由循环 | 把退款目标、订单工具、政策检索和资金工具交给Agent;它自行决定先查什么、何时追问、何时提交结果 |
| 状态图 | ENTRY→查订单→验政策→条件边:自动退款/人工审批/拒绝→END,每一步状态可检查点恢复 |
| 工作流 | 退款事件触发;订单校验和风险检查并行;汇聚后按金额路由;失败重试,超时进入人工队列 |
| 角色协作 | 客服Agent收集情况,政策Agent判断条款,风控Agent审核风险,Manager汇总并验收最终决定 |
| 平台运行 | 渠道消息进入Runtime,加载用户、租户和Session,执行任一内部编排,记录Trace并持久化结果 |
生产系统通常不是五选一,而是分层组合: 平台负责活着,图和工作流负责别乱跑,角色负责分工,自由循环负责处理那些没人提前想明白的问题。
五、选型决策框架
选型之前,先回答三个问题:
① 失败能不能重来?
- 不能 → 优先显式图、检查点、审批和幂等设计,先看LangGraph/MAF
- 能 → 轻量SDK或角色协作框架足够
② 难点到底在哪?
- 文档检索 → LlamaIndex
- 类型和结构 → PydanticAI
- 长期记忆 → Letta
- 多端平台 → Agno
③ 团队会什么?
- Python → LangGraph、PydanticAI、CrewAI
- TypeScript → Mastra、OpenAI SDK
- Java/Spring → Spring AI Alibaba
- .NET → Microsoft Agent Framework
六、生产落地的共同规律
从各框架的公开案例中可以总结出几条共性规律:
- 自治与审查并存:所有生产级Agent系统都在关键节点嵌入人工审批(HITL)或规则校验
- 先测检索,再谈Agent:RAG类Agent的成功率高度依赖检索质量,LlamaIndex等框架的价值在于先把数据地基打牢
- 从问题出发选框架:不是“哪个框架最好”,而是先把业务题目念完——例如需要长期记忆的选Letta,需要Java企业集成的选Spring AI Alibaba
- 降低Token成本是必修课:Google ADK等框架内置的上下文工程能力,正在成为生产级选型的硬性指标
七、结语
Agent框架的竞争已经从“功能数量”转向了 “生产环境的确定性” 。一个框架的真正价值,不在于演示时能完成多复杂的任务,而在于任务失败时能否恢复、状态变化时能否审计、成本失控时能否刹车。
选型不是问“谁最火”,而是问你的擂台、兵器和失败代价是什么。 八个不会干活的Agent,只是把无效会议搬进了token账单。
更多推荐




所有评论(0)