本文由 GO FUNNY 出品。专注 AI Agent 协作方法论与开源工具深度解读。

你想搭一个 AI agent,打开 GitHub 搜「agent framework」,按 star 排序,点进第一名,照着 quickstart 敲完,跑通了一个 demo——觉得这事稳了。然后你往里塞真实业务逻辑,某天半夜它崩了,你发现状态恢复不了、查不出它为什么走错了分支,回头翻文档,才在某行小字里看到:这个项目已经进入维护模式。你以为跟着最多人的选择最保险,结果踩进一个连作者都不再往里加东西的仓库。

开头那个仓库叫 AutoGen——GitHub 上 star 最多的 agent 框架,60.4k,比第二名 CrewAI 还高出一截。光看数字,你会觉得选它最安全:社区大、issue 多、博客都在写。但微软 2026 年 4 月把它和 Semantic Kernel 合并成了 Microsoft Agent Framework,发布了 1.0,原 AutoGen 仓库从此只修 bug、不加新功能。维护模式的意思是,别人都在往前跑,你的框架停在原地——新能力没有,生态跟不上,社区重心也早搬走了。一个新项目这时候还从它起步,等于一开始就背上一笔迟早要还的技术债。

所以这篇不按 star 给你排榜。我想反着来:先帮你想清楚自己到底要造什么,再把 2026 年主流的框架一个一个摆开,各自的脾气、优点、坑,都讲明白。框架这东西,火不等于适合你——适合你的,是那个配得上你场景、出事你能查的那个。

一、先想清楚你在造什么

选框架之前,先回答四个问题,按这个顺序问自己,基本不会选错:

  1. 你团队用什么语言?Python 和 TypeScript 能用的好东西差很多。
  2. 你已经绑了哪家模型?深度用 OpenAI 就别硬上只认 Claude 的 SDK。
  3. 你的 agent 跑一步还是跑一天?只跑一步的活,框架很多能力你根本用不上。
  4. 出事了你能不能查?能不能在崩溃后从断点续上,能不能告诉老板「它为什么这么干」。

这四个问题比 star 数重要十倍。但光问还不够,还得知道市面上有哪些可选。下面先给你一张全景,再按场景拆开讲优缺点。

二、2026 年主流框架有哪些

下面这十个,是 2026 年你会真正碰到的 agent 框架 / SDK。先按语言和定位分个类:

框架 主语言 定位 Star (2026-08)
AutoGen Python 多智能体对话(已并入 MAF,维护模式) 60.4k
CrewAI Python 角色型多智能体,原型快 56.9k
LlamaIndex Python 数据重 / RAG 型 agent 51.6k
LangGraph Python 有状态生产级工作流 39.5k
smolagents Python 极简代码优先 28.8k
OpenAI Agents SDK Python OpenAI 生态官方 SDK 28.6k
Semantic Kernel Python/.NET 企业中间件(已并入 MAF,维护模式) 28.4k
Mastra TypeScript TS 全栈 agent 27.1k
Google ADK Python/Java Gemini / Vertex 官方 21.1k
Pydantic AI Python 类型安全 / 输出校验 19.2k

有个反常识的事得先说:star 前两名(AutoGen、Semantic Kernel)现在都进入维护模式了。所以别盯着星数往下排,按你自己的场景挑才靠谱。

三、按场景挑,优缺点一次看清

3.1 要快、多角色分工:CrewAI

从零搭一个多智能体原型,CrewAI 是最快能跑起来的。它的心智模型是「角色」:你定义一个研究员、一个写手、一个审校,框架帮你协调他们对话。产品经理拿这套跟开发描述需求时,几乎不用翻译。空仓库到能跑的 demo,两到四个小时。

  • 优点:上手最快;角色抽象直观;PM 和开发沟通成本低。
  • 缺点:状态管理早期被藏起来,要做持久状态、人工审批、合规审计会很别扭;上它的 Flow 抽象学习曲线一下子变陡;生产级有状态流程容易撞墙。

一句话:出原型用它,准备好之后迁到 LangGraph。CrewAI 56.9k star,融资 1800 万美元,官方说财富 500 强里六成在用——但注意这个「在用」很多是原型阶段,不是核心生产系统。

3.2 复杂、有状态、要审计:LangGraph

需要复杂、有状态、能断点恢复的流程,LangGraph 是目前最稳的。它把 agent 当成一张有向图,每个节点干一件事,边控制流向,每一步的输入输出都可观测、可恢复,出事了你能精确看到卡在哪个节点。

最有说服力的案例是 Klarna:客服 bot 跑在 LangGraph 上,处理了三分之二的咨询,干着 853 个全职员工的活,一年省 6000 万美元。半夜三点系统出问题,他们的工程团队能照着图推理。

  • 优点:有状态、可恢复、可观测、生产成熟;Klarna 级案例证明能扛量。
  • 缺点:上手慢,第一天就得想图和状态机;对只想快速试验的人不友好。

一句话:流程要跑很久、要人工介入、要有据可查,就选它。LangGraph 39.5k star,月下载 3450 万,公开生产部署约 400 家(Cisco、Uber、LinkedIn、BlackRock)。

3.3 数据重、RAG 为主:LlamaIndex

如果你的 agent 核心是检索增强——要查文档库、知识库、结构化数据,LlamaIndex 是这条线的代表,51.6k star。它从「索引数据」起家,agent 能力是后来加上的。

  • 优点:数据连接器和索引抽象成熟,RAG 流程开箱即用。
  • 缺点:纯 agent 编排能力不如 LangGraph 专;定位偏「数据层」,不是「编排层」。

一句话:你的 agent 主要在「读文档、查知识库」,先看它。

3.4 只要最小积木:轻量 SDK 一族

不想扛一整套框架、只要几个干净原语的团队,2026 年几家模型厂都官方下了场:

OpenAI Agents SDK  — agents + handoffs + guardrails + sessions,自带 tracing
Pydantic AI        — Python 团队类型安全 + 输出校验
Google ADK          — Google 官方,认 Gemini/Vertex,双语言 Python/Java
smolagents (HF)     — 极简代码优先,28.8k star
  • OpenAI Agents SDK:名字叫 OpenAI,但通过 LiteLLM 能接 100 多个非 OpenAI 模型。深度绑 OpenAI 的最短路径,tracing 开箱即用;缺点是换模型要重写不少。
  • Pydantic AI:做分类、抽取、文档问答这类结构化输出,schema 校验比裸聊天稳得多,受监管场景首选;19.2k star,生态小,复杂编排能力弱。
  • Google ADK:打动传统企业 Java 团队,GCP 栈顺手;不是 GCP 栈就别硬凑,绑定死。
  • smolagents:想自己掌控每一行就用它;什么都要自己拼,没有现成编排。

3.5 TypeScript 全栈:Mastra

整个栈是 TypeScript,Mastra 基本是唯一像样的答案。2026 年 1 月发布 1.0,YC 背书,支持 81 个 provider、2436+ 模型,durable workflow、memory、evals、tracing 一套打包。Replit 的 Agent 3 建在它上面,任务成功率从 80% 拉到 96%;Marsh McLennan 用它的搜索工具覆盖了 75000 名员工。

  • 优点:TS 栈不用拿 LangChain.js 凑合,全家桶省拼库。
  • 缺点:还年轻,生态深度比不过 LangGraph 那种老兵。

一句话:写 TS agent,它是当前首选。Mastra 27.1k star。

3.6 Azure / .NET 栈:Microsoft Agent Framework

这是 AutoGen 和 Semantic Kernel 的合体,2026 年 4 月 1.0 GA,融合了 Semantic Kernel 的企业级中间件和 AutoGen 的编排创新,支持 Python 和 .NET、MCP 和 A2A 协议、checkpoint、人工介入。

  • 优点:.NET 栈、绑 Azure 的官方正路,不用再碰两个维护模式仓库。
  • 缺点:非 Azure 团队基本不用考虑它,绑定重。

四、一个被反复验证的趋势:工具层用 MCP

不管你选哪个框架,工具调用那一层现在有个事实标准叫 MCP(Model Context Protocol)。它的意义是让你的 agent 能跨框架移植:今天用 LangGraph,明天想换 Mastra,工具定义不用重写。

所以 2026 年靠谱的工程参考架构基本是这样:

编排框架 (LangGraph / MAF)
   + 可观测栈 (LangSmith / Pydantic Logfire)
   + 评测 harness
   + 基于 MCP 的工具层

还有一点很现实:多数生产团队不是「纯框架」,而是框架负责编排,性能敏感的关键路径直接调模型 API。框架是手段,能跑起来的生产系统是目的,中间的距离靠纪律补。

五、什么时候你其实不该用框架

这部分我犹豫要不要写,因为它跟前面有点唱反调。但我觉得得说。

2026 年有个 Hacker News 热帖叫「受够了 Agent 框架」,还有 Reddit 上高赞帖说 90% 的 agentic 项目用简单 prompt chain 更好。两件事同时成立:框架在大型企业的确开始回本,可开发者也被抽象层的折腾搞累了。

更扎心的是 MIT 一项覆盖 300+ 实现的研究:从试点到真正上生产的成功率只有约 5%。也就是说,绝大多数 agent 项目死在 demo 之后。框架救不了这个——它只管编排,不管你的业务逻辑对不对、数据干不干净、成本扛不扛得住。

所以我的判断是:如果你的任务就是「调一次模型、串几个固定步骤」,别上框架,写个普通函数加几次 API 调用就够了。框架的价值在长流程、有状态、要恢复、要审计的地方。别为了用而用。

六、速选清单

懒得逐条想的话,按下面这个对号入座:

  • 要做原型、要快、多角色分工:CrewAI,但想清楚之后要不要迁。
  • 流程要跑很久、要断点恢复、要给人看轨迹:LangGraph。
  • 数据重、RAG 为主:LlamaIndex。
  • 整个栈是 TypeScript:Mastra。
  • Python 团队、输出要类型校验:Pydantic AI。
  • 深度绑 OpenAI:OpenAI Agents SDK。
  • 深度绑 Gemini / GCP:Google ADK。
  • Azure / .NET 栈:Microsoft Agent Framework。
  • 只想要最小积木、自己掌控:smolagents 或直接调 API。
  • 新项目,别碰:AutoGen、Semantic Kernel(都已并入 MAF,维护模式)。

最容易栽跟头的选法,就是照着 GitHub star 榜从上往下点——半年后回头看,成本、可靠性、可观测性,多半没人认真算过。

GO FUNNY|AI Agent 协作方法论 × 开源工具深度解读

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐