【学习笔记】从OpenClaw看AI Agent的新型攻击面与威胁建模挑战
一、背景
近年来,AI系统正逐步从传统问答助手演进为具备自主规划、工具调用与任务执行能力的Agent(智能体)系统。
当企业开始把AI Agent接入飞书、邮箱、代码仓库、ERP、OA后,AI已不再只是聊天工具,而开始具备“代替员工执行操作”的能力。
以OpenClaw(业内也称其为“龙虾”)为代表的开源Agent平台,以大语言模型为核心,目前已经支持连接 Telegram、WhatsApp、飞书、钉钉等20余个即时通讯平台,且可通过ClawHub Skill市场扩展能力,支持文件读写、代码执行、浏览器操控等高权限操作,并具备跨会话的持久化记忆机制。许多开发者和团队已将其部署为真正意义上的"自主执行助手"。
这类平台在提升自动化能力的同时,也显著扩大了AI系统的攻击面。
一旦被攻击,影响的不再只是模型输出错误,而可能直接导致:内部数据泄露、财务误操作、自动化流程被篡改、越权访问企业系统、供应链投毒、合规违规(如个人信息、跨境数据)。
今年年初,研究人员就披露了被称为“ClawHavoc”的大规模恶意Skill投毒事件。攻击者通过向Skill市场持续上传伪装成自动化工具、开发辅助插件的恶意Skill,在Agent执行链路中植入信息窃取、数据外传及远程控制能力。在高峰时期,恶意Skill一度占据市场相当比例。
国家信息安全漏洞库(CNNVD)、国家互联网应急中心(CNCERT)、中央网信办数据与技术保障中心(DTSC)以及中国信通院也纷纷下场,均针对 “养龙虾”发布风险提示,指出其:默认配置安全性不足、Agent权限过高、存在Prompt Injection风险 、Skill生态缺乏有效治理,并提醒重点行业谨慎部署相关能力。
值得关注的是,上述问题中相当一部分并非传统软件漏洞,而是AI Agent在“自主规划+工具调用+长期记忆”模式下产生的新型攻击面。
在识别Web、业务系统等场景的常规风险时,传统威胁建模方法(如STRIDE、PASTA)已得到广泛应用,但在AI Agent场景下,面对动态工具调用、多代理协同及自主任务执行等特性,仍存在一定适配挑战。
本文基于英文参考文献(见文末)内容,结合OpenClaw场景,对MAESTRO(Multi-Agent Environment, Security,Threat, Risk, and Outcome)框架在AI Agent系统中的应用思路进行分析。
二、主流威胁建模框架总体对比
2.1 总体横向对比
图片从不同关键维度,对5种主流威胁建模框架进行横向对比:

2.2 MAESTRO框架
MAESTRO框架基于一个七层参考架构,从最底层的基础模型到最顶层的代理生态系统,每一层都代表智能体AI系统中的一个关键组件,并拥有独立的威胁面和对应的安全控制措施。这种分层设计使安全团队能够在细粒度级别上理解和解决各层特有的风险,下图为具体架构层级总览:

三、OpenClaw 威胁建模
将MAESTRO框架应用于实际OpenClaw时,可遵循以下六步,将框架理论转化为可操作安全实践:
3.1 步骤1 OpenClaw系统分解
按照七层架构对OpenClaw系统进行全面分解,明确每个组件归属于哪一层级,绘制系统架构图,标注各层组件之间的数据流和交互关系。
案例
-
基础模型层:
支持OpenAI/Gemini/本地 LLM推理接口、提示词模板引擎
数据操作层:
-
短期上下文记忆、长期向量记忆库、本地文件读写接口
智能体框架层:
-
自主任务规划器、指令解析器、目标管理器、工具调用模块、推理引擎
部署基础设施层:
-
本地进程、Docker容器、主机网络、文件系统、CLI/Web UI入口
评估与可观测性层:
-
基础接口日志、模型调用统计、无全链路行为审计、无异常告警 、历史执行记录
安全与合规层:
-
默认无身份鉴权、无RBAC权限控制、无插件签名校验、无数据脱敏
智能体生态层:
-
第三方插件加载器、外部API集成、多智能体消息总线、插件市场
3.2 明确三方面:
-
业务目标:
自主完成多步骤任务、代码执行、文件操作、数据处理
-
核心能力:
-
文本理解、自主任务分解、多步规划、系统命令执行、动态插件加载
-
数据流向:
-
用户输入 → 指令解析 → 任务规划 → 调用工具 / 插件 → 本地执行 → 结果返回 → 写入记忆
3.2 步骤2 特定层威胁建模
针对识别出的每一层组件,参照对应层级的威胁清单,识别当前系统中存在或可能存在的具体安全威胁。
案例
对OpenClaw智能体框架,逐层识别真实威胁:
-
基础模型层:
直接/间接提示词注入、越狱攻击、模型输出误导、指令混淆
数据操作层:
-
记忆投毒、上下文篡改、敏感信息记忆泄露、向量库未授权访问
智能体框架层:
-
目标操纵、指令劫持、任务逻辑篡改、工具调用越权
部署基础设施层:
-
容器逃逸、本地文件越权读写、系统命令无限制执行、网络外联无管控
评估与可观测性层:
-
无全链路行为日志、攻击无法溯源、异常执行无告警
安全与合规层:
-
权限粗粒度(默认高权限)、插件无签名验证、敏感操作无人在回路
智能体生态层:
-
恶意插件加载、第三方API投毒、跨入口注入、多智能体消息篡改
最终输出分层威胁清单,每条威胁包含:威胁位置、触发条件、可利用方式。
3.3 步骤3 跨层威胁识别
分析各层之间的接口和交互关系,重点识别供应链攻击、横向移动等跨越多层的复合威胁场景。
案例
-
攻击者在基础模型层通过CLI入口输入恶意提示词,植入隐藏指令
-
恶意载荷绕过模型层安全校验与内容检测,欺骗智能体判定为合法任务
-
智能体框架层被诱导,调用系统命令执行类工具,输入参数未做过滤与校验
-
安全合规层默认高权限配置,结合部署层命令/文件无隔离能力,读取数据操作层本地敏感文件
-
缺失可观测层日志记录,合规层无审计与权限管控,攻击全程无告警、无法溯源
典型跨层威胁路径:
模型层入口注入 → 模型层风控绕 → 智能体框架层工具滥用 → 合规层权限溢出 + 部署层高危能力裸奔 → 数据操作层资产泄露 → 可观测&合规层无感知隐身
跨层分析的核心不是列威胁,而是画出“从入口到核心资产” 的完整攻击路径。
3.4 步骤4 风险评估与优先级排序
对识别出的所有威胁进行量化风险评估,综合考量威胁发生的可能性和潜在影响,形成优先级排序的风险清单。
采用AIVSS(AI Vulnerability Scoring System) 对威胁标准化评分,该体系融合CVSSv4.0传统漏洞维度(攻击复杂度、权限要求等)与AARS智能体能力维度(自主行动、目标规划等10项AI特有指标),通过下图所示公示计算最终得分。

风险等级分为Critical(极高)、High(高)、Medium(中)、Low(低)四级。在MAESTRO威胁建模框架中,该得分是威胁优先级排序的核心依据。
案例(OpenClaw )
我们对MAESTRO框架识别出的典型威胁—Agent Goal and Instruction Manipulation(智能体目标与指令操纵,即提示词注入类攻击),执行AIVSS全维度评分:
CVSS v4.0 传统漏洞维度)
-
攻击复杂度(AC):低 → 普通文本即可构造恶意提示词,无需特殊技术
-
权限要求(PR):无权限 / 匿名可访问 → 任意用户均可发送注入指令
-
用户交互(UI):无需 → 直接向智能体发送指令即可触发,无需诱导其他用户
-
机密性影响(VC):高 → 诱导智能体泄露企业知识库、员工信息等敏感数据
-
完整性影响(VI):高 → 篡改智能体的执行目标,使其执行未授权的工单操作、邮件发送等行为
-
可用性影响(VA):高 → 恶意指令可导致智能体进程阻塞,影响正常业务使用
-
后续系统影响(SC/SI/SA):无 → 攻击仅影响智能体本身,未扩散至其他业务系统
CVSS 基础得分:9.3
AARS 智能体能力维度(AI 特有风险)
-
自主行动(Autonomy of Action):部分(0.5)→ 智能体仅按注入指令执行部分操作,未完全脱离业务逻辑
-
工具使用(Tool Use):部分(0.5)→ 借助注入指令调用部分业务工具,未获取全量工具权限
-
记忆使用(Memory Use):无(0.0)→ 未跨会话留存恶意指令,仅单次会话生效
-
动态身份(Dynamic Identity):无(0.0)→ 未通过注入指令切换智能体身份
-
多智能体交互(Multi-Agent Interactions):无(0.0)→ 未触发多智能体协同,仅影响单智能体
-
非确定性(Non-Determinism):完全(1.0)→ 注入指令的执行结果不可预测,智能体行为异常无固定规律
-
自我修改(Self-Modification):无(0.0)→ 未修改智能体核心规则,仅临时篡改执行指令
-
目标驱动规划(Goal-Driven Planning):完全(1.0)→ 智能体按注入的恶意目标,自主规划多步执行流程
-
上下文感知(Contextual Awareness):完全(1.0)→ 智能体精准理解恶意提示词的语义,执行针对性操作
-
不透明与反思(Opacity and Reflexivity):无(0.0)→ 注入行为可通过智能体日志追溯,操作痕迹未隐藏
AARS 智能体能力得分:4.0
AIVSS 综合评分
-
威胁乘数(Threat Multiplier):1.0(企业普通生产场景,无额外风险放大)
最终得分:2(9.3+4.0)×1.0=6.7
风险等级:Medium(中危)
3.5 步骤5 制定缓解计划
为高优先级威胁制定具体的缓解计划,结合特定层措施、跨层措施和AI专用安全控制,分配资源并设定实施时间表。
案例
系统指令优先级加固
-
固化系统Prompt、能力边界、行为约束,禁止用户输入拼接、覆写、截断系统指令;
-
采用独立上下文隔离容器,用户不可修改预设安全基线指令。
输入与输出层防护
-
输入侧:采用隔离式Prompt结构,将系统指令与用户输入严格分区,使模型不会将用户内容误判为新指令;同时对输入进行关键词过滤,限制单轮输入上限、历史上下文窗口大小等。
-
输出侧:对模型返回内容进行校验,若发现偏离任务、违规行为或敏感信息,立即截断。
3.6 步骤6 实施、监控与迭代
落地实施安全控制措施,建立持续监控机制,并随着AI技术发展和威胁格局演变,定期更新和优化威胁模型。
案例
-
监控:异常高频调用、越权工具访问、可疑关键词输入
-
每周:扫描模型、框架、容器镜像更新,检查新CVE
-
每月:重新跑一次MAESTRO六步流程,更新威胁模型
-
每次模型微调 / 知识库更新:重新做一次轻量级风险评估
AI应用后续新增 “自动审批” 能力,智能体可调用系统,则必须在生态层、框架层、数据层重新识别威胁,更新风险清单。
四、威胁建模之OpenClaw详解
以下按从底层(第1层)到顶层(第7层)的顺序,逐一分析OpenClaw每层的安全威胁与对应的缓解措施。
第1层:基础模型(Foundation Model)
基础模型是智能体AI系统的"大脑",提供核心推理、生成和工具使用能力。包括大语言模型(LLM)等底层AI模型,是整个代理系统的基础。一旦此层被攻破,影响将蔓延至所有代理行为。

第2层:数据操作(Data Operations)
数据操作层包含数据获取、存储、预处理、标记、嵌入生成、向量数据库和RAG检索等整个数据管道。代理的行为质量高度依赖于数据的完整性与安全性, 本层威胁涉及凭证存储安全、文件系统权限、会话历史泄露和向量数据库污染,是OpenClaw当前风险最集中的层级之一。

第3层:代理框架(Agent Framework)
代理框架层是连接大模型基础能力与外部工具、业务工作流的核心编排层,典型代表包括LangChain、AutoGen、CrewAI等主流智能体开发框架。该层内置任务规划器、路由调度、记忆管理、工具调用等核心能力,负责让智能体理解目标、拆解任务、选择工具、自主执行。

第4层:部署与基础设施(Deployment&Infrastructure)
部署与基础设施层是AI代理运行的底层环境,包括云账户、网络、容器、Kubernetes、IAM策略和CI/CD管道。基础设施的安全弱点可能导致代理安全事件演变为全面的平台级泄露。

第5层:评估与可观测性(Evaluation & Observability)
评估与观测性层负责监控和评估AI代理的运行状态,包括数据、日志、跟踪、评估工具、安全监控器和红队测试套件。由于代理行为具有不确定性,强大的可观测性至关重要。

第6层:安全与合规(Security & Compliance)
安全与合规层是贯穿所有其他层的垂直治理层,包括策略执行、风险管理、可审计性和监管合规性控制。它确保AI代理的所有操作都符合法律法规要求,并能承担相应的责任。

第7层:代理生态系统(Agent Ecosystem)
代理生态系统层是AI代理与用户、其他代理、工具、插件和市场交互的顶层环境。它涵盖各种商业应用和市场场景,面临多代理动态交互、身份冒充和经济操纵等独特风险。

五、MAESTRO框架落地的工具与能力考量
在MAESTRO框架落地过程中,工具可作为辅助手段提升效率,但核心价值在于专业团队对框架的理解、对AI智能体技术的掌握以及对企业业务场景的融合。
目前市面已有部分支持AI威胁建模的工具,可实现基础的威胁清单生成、风险矩阵量化、分层架构可视化等功能,但其核心逻辑均基于MAESTRO、STRIDE等主流框架,功能大同小异。
真正的MAESTRO框架落地,并非简单的工具操作,而是需要具备系统威胁建模、AI 技术理解、架构安全设计三重能力的专业团队,通过人工分析与工具辅助结合的方式,实现威胁模型的精细化、场景化、体系化构建。工具可解决 “效率问题”,但专业团队才能解决 “效果问题”,这也是MAESTRO智能体威胁建模与传统IT系统建模的核心区别。
MAESTRO框架的具体特征可归纳为以下五大方面:
5.1 MAESTRO专为智能体AI设计,在STRIDE等传统威胁建模方法基础上增加AI方面的风险识别;
5.2 七层架构提供了覆盖AI系统全栈的系统化安全分析框架;
5.3 跨层威胁分析弥补了单层分析的盲点,尤其适用于复杂多代理系统;
5.4 AI专项控制措施(对抗性训练、形式化验证)是框架的核心创新;
5.5 安全需要持续迭代,而非一次性完成的静态工作。
六、结语
基于对 OpenClaw 协议架构、通信流程与潜在风险点的系统性梳理,我们完成了从威胁识别、场景推演到防护建议的全链路威胁建模,帮助企业清晰识别关键风险面,形成可落地的安全加固路径,为业务通信架构的安全稳定运行筑牢基础。
参考文献
1. https://cloudsecurityalliance.org/blog/2025/02/06/agentic-ai-threat-modeling-framework-maestro
2. https://cloudsecurityalliance.org/blog/2026/02/20/openclaw-threat-model-maestro-framework-analysis?spm=5176.28103460.0.0.39f27551yTrw6D
3. CSA MAESTRO Labs: https://labs.cloudsecurityalliance.org/maestro/
4. GitHub: https://github.com/CloudSecurityAlliance/MAESTRO
5. Https://aivss.parthsohaney.online/calculator
更多推荐
所有评论(0)