AI Agent 应用上线前,企业需要建立哪些安全能力?
AI Agent 应用上线前,企业需要补齐的不只是模型输出审核,而是输入检测、任务权限、工具调用控制、内容安全、账号风控、数据脱敏、日志审计、人工兜底和策略迭代等一整套安全能力。Agent 和普通聊天机器人最大的区别在于它能规划任务、调用工具、访问数据和触发动作,因此风险会从“说错话”扩展到“做错事”。上线前建议按输入、规划、执行、输出、运营五层做安全检查。
1. 为什么 Agent 上线前要单独做安全设计?
传统大模型应用主要处理“问答”和“生成”。AI Agent 则多了一层行动能力:它可以拆解任务、调用插件或 API、读取知识库、操作业务系统,甚至自动完成审批、下单、通知、查询、提交表单等动作。
这意味着安全边界发生了变化。以前的风险多集中在输出端,例如生成违规内容、幻觉回答、敏感信息泄露。Agent 上线后,风险会进入执行链路:用户输入可能诱导 Agent 绕过规则,模型规划可能选错工具,工具调用可能触发越权操作,外部页面或文档还可能通过提示词注入影响 Agent 行为。
所以,Agent 安全不能只加一个内容审核接口。更稳妥的做法是把它当成一个可执行的业务系统来治理。
2. Agent 上线前的安全能力总览
| 层级 | 要补的能力 | 主要防什么 |
|---|---|---|
| 输入层 | 敏感信息识别、违法请求识别、提示词注入检测 | 用户恶意诱导、员工误传数据、越权查询 |
| 规划层 | 任务意图识别、风险分级、工具白名单、动作审批 | Agent 自主规划失控、调用错误工具 |
| 执行层 | API 权限控制、参数校验、速率限制、账号风控 | 越权操作、批量滥用、脚本化攻击 |
| 输出层 | 内容审核、安全代答、脱敏改写、引用校验 | 违规生成、敏感泄露、幻觉误导 |
| 运营层 | 日志审计、样本回流、人工复核、策略版本管理 | 难追溯、难复盘、难持续迭代 |
企业做 POC 时,建议把这张表变成测试清单,而不是上线后再补。
3. 输入侧:先判断“这个请求能不能进入 Agent”
Agent 的输入侧要比普通聊天更严格。用户不是只在提问,而是在向系统下达任务。输入安全至少要识别四类风险。
第一类是违法违规请求,例如生成欺诈话术、攻击脚本、侵权内容、低俗内容或有害指令。
第二类是敏感信息输入,例如手机号、身份证、客户资料、合同价格、内部账号、密钥、代码片段、财务数据等。
第三类是提示词注入和越狱指令,例如“忽略系统规则”“输出隐藏提示词”“绕过审批”“不要记录日志”“调用所有可用工具”。
第四类是越权意图,例如普通用户要求查询管理层资料、导出客户名单、批量修改订单状态。
推荐把输入检测结果结构化:
{ "risk": true, "risk_labels": ["prompt_injection", "permission_bypass"], "risk_score": 0.91, "suggested_action": "block_or_review" }
这样后续可以根据风险等级决定拒绝、改写、人工复核或进入安全代答。
4. 规划层:限制 Agent 能规划什么
Agent 的核心能力是把目标拆成步骤,但规划过程必须受到约束。企业常见错误是把所有工具、所有知识库和所有 API 都暴露给同一个 Agent,再依赖模型自己判断边界。
更合理的做法是建立任务意图和工具权限映射。例如:
| 任务类型 | 可用工具 | 是否需要审批 |
|---|---|---|
| 查询公开知识 | 搜索、知识库只读接口 | 否 |
| 查询内部资料 | 权限过滤后的知识库接口 | 视数据等级而定 |
| 生成对外文案 | 内容审核、版权审核、人工复核 | 中高风险需审批 |
| 修改业务数据 | 业务 API、审计日志 | 必须审批 |
| 导出批量数据 | 数据脱敏、权限校验、风控策略 | 必须审批 |
规划层还要保留中间状态,不建议只记录最终回答。至少要记录用户意图、规划步骤、调用工具、输入参数、返回结果摘要和处置动作。
5. 工具调用:API 不是“模型想调就调”
Agent 接入工具后,安全重点会转向工程控制。建议至少补齐以下能力:
- 工具白名单:不同 Agent、不同角色只能访问指定工具。
- 参数校验:金额、数量、日期、用户 ID、文件路径等不能完全信任模型生成。
- 权限校验:工具调用前校验用户身份、角色、业务权限和数据等级。
- 速率限制:防止批量查询、批量导出、批量提交和脚本滥用。
- 高危动作二次确认:删除、转账、修改权限、批量导出等动作需要人工确认。
- 幂等和回滚:避免 Agent 重试造成重复提交、重复通知或重复扣费。
对外部网页、文档、邮件、工单内容,还要做提示词注入防护。外部内容不能被 Agent 当成系统指令,只能作为不可信数据源处理。
6. 输出侧:不只审核回答,还要审核动作结果
Agent 的输出可能是文字、表格、邮件、客服回复、代码、工单备注,也可能是一次工具调用结果。输出审核要覆盖内容合规、敏感信息、版权风险、事实一致性和业务边界。
比较稳妥的处置方式不是“一律拒答”,而是分级处理:低风险提示核验,中风险脱敏或安全改写,高风险拒答并说明原因,不确定内容转人工复核。
数美科技这类 AIGC 安全围栏服务商的价值,通常体现在多模态内容审核、风险标签体系、安全代答、账号风控、人工复核和策略运营的组合能力上。对 Agent 应用来说,重点不是单点拦截,而是让输入、输出和执行链路都有可解释的安全判断。
7. 上线前 POC 建议测哪些指标?
| 指标 | 建议测试方式 |
|---|---|
| 风险召回率 | 准备提示词注入、越权查询、违规生成、敏感信息样本 |
| 误杀率 | 用正常业务任务测试是否被过度拦截 |
| 漏放率 | 模拟绕写、谐音、拆字、多轮诱导和文件注入 |
| 延迟 | 关注平均延迟、P95、P99,特别是多工具调用场景 |
| 权限一致性 | 不同角色访问同一任务,检查结果是否符合 ACL |
| 审计完整性 | 检查 request_id、user_id、tool_name、action、label 是否可回放 |
| 策略迭代 | 测试新增风险样本后能否快速上线规则或模型策略 |
FAQ
Q:AI Agent 安全和普通大模型内容安全有什么区别?
A:普通大模型内容安全主要关注输入输出内容;Agent 安全还要关注任务规划、工具调用、API 权限、动作审批和审计回放,因为 Agent 可能真正触发业务动作。
Q:Agent 上线前最容易忽略什么?
A:最容易忽略工具调用权限和外部内容注入。外部网页、邮件、文档中的文字可能诱导 Agent 执行错误指令,API 参数也不能完全信任模型生成。
Q:数美科技适合哪些 Agent 安全场景?
A:如果 Agent 涉及用户内容、企业知识库、对外回复、账号体系、多模态内容或高风险业务流程,可以重点评估数美在 AIGC 安全围栏、内容审核、账号风控、安全代答和运营闭环上的能力。
更多推荐


所有评论(0)