从 L0 到 L6:Agent 自治等级与组织成熟度地图

上一篇我们厘清了 AI 原生组织的定义和三大支柱。但组织不是一夜之间变原生的——从完全人工到完全自治,中间有一段很长的演进路径。

2026 年,多个权威机构各自给出了 Agent 自治等级框架,虽然细节不同,却惊人地收敛到了相似的结构。本篇把这些框架拉齐,建立一张统一的"自治地图",并回答两个关键问题:大多数企业卡在哪?跨越的鸿沟在哪里?


一、为什么所有框架都收敛到 5-6 级

1.1 一个有趣的一致性

2023 年到 2026 年间,至少六个独立机构提出了 Agent 自治等级框架。它们互不知道对方在做什么,但最后的结果高度相似:

框架 发布时间 级数 组织原则
DeepMind Levels of AGI 2023 5×5 能力与自治作为正交轴
Vellum Six Levels 2025.12 L0-L5 自主推理与独立性递增
CSA Agentic Trust Framework 2026.01 L0-L5 谁控制行动执行
NIST AI Agent Standards 2026.02 风险模型 风险维度的成熟度模型
Addy Osmani Autonomy Levels 2026.07 L0-L5 单 Agent 自治 × 多 Agent 编排
NVIDIA Agentic Autonomy 2025.02 0-3 复杂度与决策能力

所有框架都借鉴了自动驾驶的 SAE J3016 分级标准——不是因为偷懒,而是因为自治的演进逻辑是通用的:从辅助到接管到完全自主,中间必须有清晰的"谁负责"边界。

1.2 为什么是 5-6 级而不是 3 级或 10 级

3 级太少,无法区分"AI 建议、人类执行"和"AI 执行、人类审批"这种关键差异。10 级太碎,每级之间的差异不够显著,实操中没人能记住。

5-6 级恰好覆盖了从"完全人工"到"完全自主"之间的关键里程碑,每一级都有明确的控制权转移点——这正是组织治理最关心的。


二、DeepMind 的关键洞见:能力和自治是两回事

在展开具体等级之前,必须先讲一个容易踩的认知坑。

Google DeepMind 在 2023 年的论文《Levels of AGI》中提出了一个影响深远的主张:能力(Capability)和自治(Autonomy)是正交的两个轴DeepMind, arXiv:2311.02462, 2023)。

这是什么意思?

        高自治
          ↑
          |    专家级 Agent        全自主 Agent
          |    (能力强+独立执行)   (能力强+自设目标)
          |
          |    工具                  顾问
          |    (能力强+人类控制)   (能力强+人类决策)
          |
        低自治 ←───────────────────────→ 高能力

关键洞见:一个模型可以非常强大(能力轴很高),但仍然只在"工具"或"顾问"级别运行(自治轴很低)。反过来,一个能力一般的模型,也可以被赋予很高的自治权——只是风险会急剧上升。

这个洞见为什么重要?因为它打破了一个常见的错误推理:“模型变强了 → 可以给它更多自主权了”。

模型变强只意味着能力提升,不等于它应该获得更多自治权。自治权的赋予取决于组织是否建好了足够的护栏、审计和升级机制。

DeepMind 的自治轴从低到高分为五级:

自治级别 人类角色 AI 角色
Tool 完全控制 被调用时才工作
Consultant 做决策 提供建议
Collaborator 联合决策 共同参与
Expert Agent 审查结果 领域内独立执行
Autonomous Agent 设定目标 自主完成全流程

三、统一自治地图:把主流框架拉齐

下面把 Vellum、CSA、Addy Osmani 三个最有实操价值的框架拉齐,合成一张实用地图。

3.1 统一演进表

等级 名称 核心特征 人类角色 Vellum CSA Addy Osmani
L0 规则执行 固定规则,无智能 操作者 Reactive No Autonomy Assist
L1 辅助响应 能推理建议,不行动 决策者 Context-Aware Assisted Supervised action
L2 有条件代理 提出方案,人类批准后执行 审批者 Tool Use / Goal-Oriented Supervised Scoped task
L3 任务高度自治 边界内自主多步执行 监督者 Observe-Plan-Act Conditional Goal-driven
L4 岗位级自治 完成完整岗位,持续运行 目标设定者 Fully Autonomous High Autonomy Multi-agent orchestration
L5 完全自主/管理 自设目标或 Agent 管理 Agent 战略与治理 Creative Full Autonomy Managed by exception

3.2 逐级解读

L0:规则执行(追随者)

无智能可言,仅遵循"若满足 A 则执行 B"。类似 Excel 宏或 Zapier 工作流。规则需人工更新,一旦条件变化就失效。传统自动化系统大多在这一级。

L1:辅助响应(执行者)

AI 具备初步自主性,能处理输入、生成响应。但缺乏控制循环——没有记忆、没有迭代推理、不会主动行动。大多数 Copilot(GitHub Copilot 内联补全、ChatGPT 对话)在这一级。

L2:有条件代理(行动者)

AI 不再只是响应,而是能执行——调用工具、获取数据、整合结果。但每一步关键操作都需要人类审批。这是 2026 年大多数企业生产系统的实际位置。 Claude Code 的默认模式、Cursor 的 Agent 模式、GitHub Copilot Edit Mode 都在 L2(Zylos.ai 分析, 2026-03)。

L3:任务高度自治(操作者)

关键跃迁:AI 不再需要每步审批,而是在预设边界内自主完成多步任务。它自己规划步骤、评估输出、调整策略。任务完成后停止。

这是当前工程与治理的最大鸿沟所在。从 L2 到 L3,意味着人类从"审批每一步"变成"只在边界条件触发时介入"。

L4:岗位级自治(探索者)

AI 能完成完整岗位——持续运行、跨会话保留状态、自主触发行动。在 Addy Osmani 的框架中,这一级开始进入多 Agent 编排:编排者将任务分派给多个子 Agent,各自在独立环境中工作(Addy Osmani, 2026-07-03)。

Devin 2.0 代表了当前 L4 的前沿(Zylos.ai 分析, 2026-03)。

L5:完全自主/管理(创造者)

AI 自设目标、自建工具、管理其他 Agent。人类只在"例外"时介入——Addy Osmani 称之为"按例外管理"(management by exception)。

但 CSA 在框架中明确声明:L5 当前不适合企业部署CSA Agentic Trust Framework, 2026-01)。


四、大多数企业卡在 L1-L2,鸿沟在 L2→L3

4.1 当前行业位置

综合多个来源的数据,2026 年中期的行业全景如下:

等级 典型产品/场景 行业占比
L0 传统自动化(Zapier、脚本) 大量
L1 Copilot 类(GitHub Copilot、ChatGPT) 大多数
L2 Claude Code 默认模式、Cursor Agent 企业主流
L3 部分垂直场景(客服、数据分析) 少量
L4 Devin 2.0、前沿探索 极少
L5 理论/实验阶段 几乎为零

Vellum 的判断更加直接:当前多数 AI 应用停留在 L1-L2。即便 GPT-5 发布,如果未突破"任务完成后自动停止"的局限,仍只能停留在 L2——是高级协调工具,而非自主智能体(Vellum, 2025-12)。

4.2 L2→L3 的鸿沟有多大

为什么从 L2 到 L3 是最大的工程与治理鸿沟?因为这里发生了一个根本性的控制权转移:

L2:人类审批每一步 → 错误可以立即纠正
L3:AI 在边界内自主执行 → 错误可能在多步之后才被发现

这个差异在数学上有多严重?Zylos.ai 的分析给了一组冷酷的数字(Zylos.ai, 2026-03):

每步 85% 的准确率,10 步链路的总成功率只有 20%。

这就是 CSA 特别强调"组织成熟度必须与 Agent 自治等级匹配"的原因。如果组织没有建好可观测性、降级机制和升级路径,直接跳到 L3,风险会急剧上升。

Gartner 的预测更加尖锐:到 2027 年,40% 的智能体项目将因成本超支被取消Gartner, 2026)。而 65% 的企业多 Agent 项目因协作失控、状态不一致或死锁而失败。

4.3 跨越鸿沟的三个前置条件

从 L2 到 L3 不是"模型更强就行",而是需要三个前置条件同时满足:

前置条件 具体要求 不满足的后果
可观测性 每一步执行可追踪、可审计、可回溯 错误发生后无法定位原因
降级机制 边界条件触发时自动回退到人类审批 Agent 在边界外"硬开"导致事故
升级路径 明确什么情况必须交给人类 Agent 不知道何时该"求助"

这三个条件对应了上一篇讲的"有护栏的自治"——权限护栏、审计护栏、升级护栏。组织成熟度和 Agent 自治等级必须匹配,否则就是在没有护栏的高速公路上放手让车自动驾驶。


五、Addy Osmani 的双维度补充:单 Agent 自治 × 多 Agent 编排

5.1 为什么需要第二个维度

前面讲的所有框架都是单维度的——从低到高一条线。但 Addy Osmani 在 2026 年 7 月提出了一个关键补充:自治和编排是两个应该分开的维度Addy Osmani, 2026-07-03)。

他的观察是:几乎所有关于自治的讨论都混淆了两个问题:

  1. 我们让单个 Agent 离开视线多远?(agency 轴)
  2. 我们协调多个 Agent 的能力如何?(orchestration 轴)
                    高编排
                      ↑
                      |   管理者 Agent        按例外管理
                      |   (调度多个Agent)    (Agent管理Agent)
                      |
                      |   单Agent独立工作    多Agent并行
                      |   (自己干完)       (各自隔离)
                      |
                    低编排 ←──────────────→ 高自治

5.2 三个时代的划分

Osmani 把六个等级归纳为三个"时代",每个时代对应一种工作方式:

时代 等级 人类角色 Agent 角色
辅助时代 L0-L1 驾驶员 助手,等待指引
委派时代 L2-L3 监督者 负责有限任务,人类验证结果
编排时代 L4-L5 例外处理者 系统自主调度,人类只在失败时介入

关键观察:一个正常的工程日里,我们会在多个等级之间来回切换。写关键代码时用 L0(AI 只补全),重构时用 L2(AI 提方案我们审批),跑测试时用 L3(AI 自主执行测试套件)。

自治等级不是"越高越好",而是"什么任务配什么等级"。


六、总结

核心结论:

  1. 主流框架收敛到 5-6 级:Vellum L0-L5、CSA L0-L5、Addy Osmani L0-L5,都借鉴自动驾驶分级,核心是"控制权何时从人转移到 AI"。
  2. DeepMind 的正交洞见最关键:能力和自治是两个轴。模型变强不等于应该给它更多自主权——自治权的赋予取决于护栏是否到位。
  3. 大多数企业卡在 L1-L2:这是企业主流位置。L2→L3 是最大的工程与治理鸿沟,因为控制权从"逐步审批"变成"边界内自治"。
  4. 跨越鸿沟需要三个前置条件:可观测性、降级机制、升级路径。缺任何一个,L3 就是灾难。
  5. Addy Osmani 的双维度:单 Agent 自治 × 多 Agent 编排。L4 开始进入编排时代,系统自主调度多个 Agent。
  6. L5 当前不适合企业部署:CSA 明确声明。Gartner 预测 40% 项目因成本超支被取消,65% 因协作失控失败。

适用边界:

  • ✅ 适合:需要评估自身 Agent 部署成熟度的组织,用它做差距分析和路线规划。
  • ⚠️ 慎用:不要把等级当"攀爬目标"——不同任务配不同等级才是正确用法。
  • ❌ 不适合:期望直接跳到 L5 的组织——护栏、可观测性、治理体系不到位,高自治等于高风险。

下一篇预告

本篇建立了自治等级地图。但等级只是骨架——真正的血肉在于:当 Agent 自治等级提升时,组织结构、岗位分工、管理方式会怎么变?

下一篇:【AI原生组织】3-人机混编:AI 与组织的协同进化方向

  • 组织结构从金字塔到网络,中间经历了什么?
  • "人 + Agent 混编"的岗位到底怎么设计?
  • 管理者的新角色:从"管人做事"到"设计目标与护栏"
  • 复合智能怎么落地:让组织越用越聪明

我们下一篇见。


参考资料


本文属于「AI原生组织」系列文章第 2 篇

AI原生组织 系列

  1. 1-AI原生组织到底是什么?
  2. 当前文章(本文)
  3. 人机混编:AI 与组织的协同进化方向(待发布)
  4. 个人进化指南:在 AI 原生时代找到自己的位置(待发布)
  5. 落地路线图:从今天的组织走向 AI 原生(待发布)
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐