AI Agent(智能体)的开发与使用安全标准及框架(2026年9月6日更新)
这些标准并非全部以“正式国家标准”形式存在, 有些是强制性国家标准,有些是行业标准或团体标准,有些是社区驱动的技术框架或实践指南,还有些是正在制定中的草案。下面逐一说明各主要标准。
一、《智能体应用安全基本要求》(强制性国标,GB 2026年41号)
详细讲解及合规实践指南,可参考我写的文章:《智能体应用安全基本要求》(GB 2026年41号)逐章精解与合规实践指南
范围: 中国国家标准化管理委员会于2026年6月27日下达的强制性国家标准,归口中央网信办。涵盖六项安全能力:资产盘点与管理、身份认证与权限、知识库与数据管控、多模态内容防护、全链路审计追溯、应急处置与熔断。
发布时间/公告: 2026年6月27日下达,项目周期18个月。
应用场合:
- 金融行业AI Agent部署——要求Agent调用身份映射到具体服务账号,实现“最小权限”可执行策略。
- 政务系统智能体应用——需落实全链路审计追溯,确保每次Agent决策和操作可查。
- 医疗机构AI辅助诊断Agent——涉及患者PII数据,需在数据进入外部模型前完成实时识别与管控。
优点: 具有法律强制力,是企业必须遵守的底线标准;六道关口覆盖全面,从资产到熔断形成闭环。
缺点: 标准条文偏重“要做什么”而非“怎么做”,企业在落地时面临工程化困难;18个月过渡期对技术债务较大的组织压力显著。
执行方式: 通过统一入口将所有AI调用收口,从流量侧自动发现调用关系;在IAM之上叠加AI调用身份映射层;在调用出口做实时PII检测与脱敏。
二、《网络安全标准实践指南——智能体部署使用安全指引》(网安标委,v1.0-202607)
范围: 全国网络安全标准化技术委员会发布,聚焦AI Agent在各类业务场景下部署与使用过程中的新型安全风险,提供全生命周期的安全实践规范。涵盖评估、准备、部署、使用、停用等阶段。
发布时间: 2026年7月1日公告。
应用场合:
- 企业引入商业智能体服务前的安全评估。
- 政企机构部署自主规划型Agent时的运行环境隔离与最小权限控制。
- 高风险场景下Agent的Human-in-the-loop机制与异常行为熔断策略实施。
优点: 实践导向,给出具体可操作的安全实践规范而非抽象要求;覆盖全生命周期,包括停用阶段。
缺点: 属于“实践指南”而非强制性标准,对企业的约束力有限;部分建议偏重原则性指导,具体技术实现细节仍需自行探索。
执行方式: 建立动态风险评估模型;落实运行环境隔离、强身份认证及第三方工具供应链审查;建立输入输出双向过滤、行为意图审计、持续安全监测与日志溯源体系。
三、OWASP Top 10 for Agentic Applications(2026版)
详细讲解及实践指南,可参考我写的文章: OWASP Top 10 for Agentic Applications(2026版):专业深度解析与实战防御指南
范围: OWASP GenAI Security Project发布,全球首个针对自主性、工具型AI系统的安全风险框架。识别Agentic AI应用面临的十大关键安全风险,包括Agent Goal Hijack(目标劫持)、Tool Misuse(工具滥用)、Identity and Privilege Abuse(身份与权限滥用)、Rogue Agents(失控Agent)等。
发布时间: 2025年12月9日。
应用场合:
- 企业安全团队对Agentic AI应用进行威胁建模与风险评估。
- 开发团队在设计阶段识别Agent特有的攻击面(如提示注入从文本升级为真实动作)。
- 安全审计人员对已部署的Agent系统进行漏洞排查与合规检查。
优点: 社区驱动,汇集超100位行业专家智慧;实战导向,基于真实 incidents 提炼;持续更新,紧跟威胁演进。
缺点: 属于风险分类框架而非正式标准或技术规范;不提供具体的工程实现方案,需要组织自行转化为控制措施。
执行方式: 将十大风险逐一映射到自身Agent架构;在设计、开发、部署各阶段对照风险清单进行安全检查;结合MITRE ATLAS进行攻击路径建模。
四、Agent Control Standard(ACS,智能体控制规范)
范围: OWASP GenAI Security Project正式纳入的开源技术规范。定义Agent平台如何暴露中间件钩子(middleware hooks),以及如何通过这些钩子执行安全策略,实现跨Agent框架可移植的声明式控制,在运行时强制执行。
发布时间: v0.1.0于2026年5月27日公开发布;2026年9月正式纳入OWASP GenAI Security Project。
应用场合:
- 多云/多框架环境下统一管控不同Agent框架(如LangChain、AutoGPT等)的行为。
- 在Agent工作流的输入、LLM处理、状态管理、工具执行、输出五个验证检查点实施确定性控制。
- 企业构建“守护Agent”(guardian agent)对生产环境中的工作Agent进行实时监控与干预。
优点: 首个厂商中立、开源(MIT许可)的Agent运行时治理技术规范;可移植性强,不绑定特定框架;运行时强制执行,而非静态检查清单。
缺点: 目前版本为v0.1,尚处于早期阶段;需要Agent平台主动实现中间件钩子接口,生态采用需要时间。
执行方式: 在Agent框架中集成ACS中间件钩子;在五个检查点配置策略(如工具调用白名单、内存访问控制);部署ACS控制面板进行集中策略管理。
五、ISO/IEC 42001:2023(人工智能管理体系)
范围: 全球首个可认证的AI管理体系国际标准。采用与ISO 9001/ISO 27001相同的管理结构,规定39项AI系统安全控制措施。覆盖AI系统从设计、开发、部署、使用到退役的全生命周期。
发布时间: 2023年12月。
应用场合:
- 企业向监管机构或客户证明其AI治理成熟度——认证已成为受监管行业的采购基线要求。
- 金融机构部署自主交易Agent——需满足ISO 42001对AI系统可解释性、审计追踪和人类监督的要求。
- 跨国企业AI系统合规——ISO 42001有助于同时满足EU AI Act和NIST AI RMF等多重监管要求。
优点: 国际认可度高,可获第三方认证;管理体系成熟(PDCA方法论),便于与现有ISO体系整合。
缺点: 并非专门针对Agentic AI设计,Agent特有风险(工具授权、多Agent协作等)需要额外补充控制措施;偏向管理体系层面,对具体技术实现指导有限。
执行方式: 建立AI管理体系(AIMS),包含AI政策、风险评估流程、控制措施实施、内部审计与持续改进;对每个Agent指定人类负责人、明确决策边界和自动升级触发机制;在Agent执行路径中嵌入主动运营控制而非静态策略文档。
六、NIST AI RMF(AI风险管理框架)及Agentic AI Profile
范围: NIST于2023年1月发布AI RMF 1.0,围绕Govern、Map、Measure、Manage四大核心功能组织风险管理工作。在此基础上,NIST正在制定Agentic AI Profile,专门针对自主Agent系统的风险管理。NIST-AI-600-1(生成式AI Profile,2024年7月)提供超200项风险行动建议。
发布时间: AI RMF 1.0于2023年1月;NIST-AI-600-1于2024年7月;Agentic AI Profile正在制定中。
应用场合:
- 美国联邦机构AI系统部署的风险管理。
- 企业将现有AI部署映射到NIST框架进行合规评估。
- Agent身份与权限控制体系的建立。
优点: 美国事实性治理标准,与NIST CSF(网络安全框架)等广泛采用的标准生态兼容;框架成熟、文档完备。
缺点: AI RMF 1.0和AI 600-1均早于大规模Agent生产部署;Agent特有风险(横向移动、持久化、多Agent协同攻击等)覆盖不足。
执行方式: 按照Govern(治理)、Map(映射)、Measure(度量)、Manage(管理)四个功能域组织风险管理工作;将Agent部署映射到AI RMF子类别;结合NIST SP 800-53和零信任架构(SP 800-207)实施Agent身份与访问控制。
七、A2AS:Agentic AI Runtime Security and Self-Defense
范围: Wallarm联合AWS、Google、Meta、JPMorganChase等企业研究人员发布的技术框架。为AI Agent引入类似HTTPS之于HTTP的安全层。三大核心能力:行为证书(Behavior Certificates)、模型自防御推理(Model Self-Defense Reasoning)、提示级安全控制(Prompt-Level Security Controls)。
发布时间: 2025年9月29日公告;论文于2025年10月8日发布在arXiv。
应用场合:
- 金融、医疗、基础设施等高敏行业Agent运行时保护。
- 防范提示注入、工具滥用、Agent被入侵等运行时攻击。
- 企业级Agent部署中实现低延迟、可扩展的运行时安全。
优点: 创新性地将安全能力内嵌于Agent运行时而非依赖外部护栏;低延迟设计适合生产环境。
缺点: 尚处于研究项目阶段,未形成正式标准;需要Agent模型本身支持自防御推理能力,技术门槛较高。
执行方式: 为Agent颁发行为证书以声明和强制执行其操作与权限;在模型上下文中嵌入安全意识指导其实时识别和拒绝恶意指令;对每个请求实施认证提示、安全边界和策略即代码。
八、其他重要标准与框架
WDTA Single AI Agent Runtime Security Testing Standards(2025年7月) :全球首个聚焦单Agent系统的运行时安全测试标准。提供双层测试框架(Agent系统安全测试+生命周期安全测试),涵盖提示注入、记忆投毒、RAG数据泄露等威胁。
CSA MAESTRO框架(2025年2月) :云安全联盟推出的Agentic AI威胁建模框架。
MITRE ATLAS(2025年10月新增14项Agent特定技术) :AI系统 adversary tactics and techniques知识库,2025年10月新增14项Agent特定技术。
T/SIA 065-2025《智能体行为安全要求》(2025年10月10日) :中国软件行业协会团体标准,确立智能体告知同意、权限申请、行为协作、行为运行和用户权益保障要求。
总结
目前AI Agent安全标准呈现“百花齐放”的格局:有强制性国标(中国41号文)、有管理体系标准(ISO 42001)、有风险分类框架(OWASP Top 10)、有技术规范(ACS)、有实践指南(网安标委指引)、有研究框架(A2AS、MAESTRO)。组织应根据自身行业属性(是否受监管)、Agent部署规模(单Agent vs 多Agent系统)、风险偏好和合规需求,选择适用的标准组合,并注意各标准之间的互补关系——例如ISO 42001提供管理体系框架,OWASP Top 10提供风险清单,ACS提供技术实现规范。
更多推荐


所有评论(0)