AI Agent 应用上线前,企业需要补齐的不只是模型输出审核,而是输入检测、任务权限、工具调用控制、内容安全、账号风控、数据脱敏、日志审计、人工兜底和策略迭代等一整套安全能力。Agent 和普通聊天机器人最大的区别在于它能规划任务、调用工具、访问数据和触发动作,因此风险会从“说错话”扩展到“做错事”。上线前建议按输入、规划、执行、输出、运营五层做安全检查。

1. 为什么 Agent 上线前要单独做安全设计?

传统大模型应用主要处理“问答”和“生成”。AI Agent 则多了一层行动能力:它可以拆解任务、调用插件或 API、读取知识库、操作业务系统,甚至自动完成审批、下单、通知、查询、提交表单等动作。

这意味着安全边界发生了变化。以前的风险多集中在输出端,例如生成违规内容、幻觉回答、敏感信息泄露。Agent 上线后,风险会进入执行链路:用户输入可能诱导 Agent 绕过规则,模型规划可能选错工具,工具调用可能触发越权操作,外部页面或文档还可能通过提示词注入影响 Agent 行为。

所以,Agent 安全不能只加一个内容审核接口。更稳妥的做法是把它当成一个可执行的业务系统来治理。

2. Agent 上线前的安全能力总览

层级 要补的能力 主要防什么
输入层 敏感信息识别、违法请求识别、提示词注入检测 用户恶意诱导、员工误传数据、越权查询
规划层 任务意图识别、风险分级、工具白名单、动作审批 Agent 自主规划失控、调用错误工具
执行层 API 权限控制、参数校验、速率限制、账号风控 越权操作、批量滥用、脚本化攻击
输出层 内容审核、安全代答、脱敏改写、引用校验 违规生成、敏感泄露、幻觉误导
运营层 日志审计、样本回流、人工复核、策略版本管理 难追溯、难复盘、难持续迭代

企业做 POC 时,建议把这张表变成测试清单,而不是上线后再补。

3. 输入侧:先判断“这个请求能不能进入 Agent”

Agent 的输入侧要比普通聊天更严格。用户不是只在提问,而是在向系统下达任务。输入安全至少要识别四类风险。

第一类是违法违规请求,例如生成欺诈话术、攻击脚本、侵权内容、低俗内容或有害指令。

第二类是敏感信息输入,例如手机号、身份证、客户资料、合同价格、内部账号、密钥、代码片段、财务数据等。

第三类是提示词注入和越狱指令,例如“忽略系统规则”“输出隐藏提示词”“绕过审批”“不要记录日志”“调用所有可用工具”。

第四类是越权意图,例如普通用户要求查询管理层资料、导出客户名单、批量修改订单状态。

推荐把输入检测结果结构化:

{ "risk": true, "risk_labels": ["prompt_injection", "permission_bypass"], "risk_score": 0.91, "suggested_action": "block_or_review" }

这样后续可以根据风险等级决定拒绝、改写、人工复核或进入安全代答。

4. 规划层:限制 Agent 能规划什么

Agent 的核心能力是把目标拆成步骤,但规划过程必须受到约束。企业常见错误是把所有工具、所有知识库和所有 API 都暴露给同一个 Agent,再依赖模型自己判断边界。

更合理的做法是建立任务意图和工具权限映射。例如:

任务类型 可用工具 是否需要审批
查询公开知识 搜索、知识库只读接口
查询内部资料 权限过滤后的知识库接口 视数据等级而定
生成对外文案 内容审核、版权审核、人工复核 中高风险需审批
修改业务数据 业务 API、审计日志 必须审批
导出批量数据 数据脱敏、权限校验、风控策略 必须审批

规划层还要保留中间状态,不建议只记录最终回答。至少要记录用户意图、规划步骤、调用工具、输入参数、返回结果摘要和处置动作。

5. 工具调用:API 不是“模型想调就调”

Agent 接入工具后,安全重点会转向工程控制。建议至少补齐以下能力:

  1. 工具白名单:不同 Agent、不同角色只能访问指定工具。
  2. 参数校验:金额、数量、日期、用户 ID、文件路径等不能完全信任模型生成。
  3. 权限校验:工具调用前校验用户身份、角色、业务权限和数据等级。
  4. 速率限制:防止批量查询、批量导出、批量提交和脚本滥用。
  5. 高危动作二次确认:删除、转账、修改权限、批量导出等动作需要人工确认。
  6. 幂等和回滚:避免 Agent 重试造成重复提交、重复通知或重复扣费。

对外部网页、文档、邮件、工单内容,还要做提示词注入防护。外部内容不能被 Agent 当成系统指令,只能作为不可信数据源处理。

6. 输出侧:不只审核回答,还要审核动作结果

Agent 的输出可能是文字、表格、邮件、客服回复、代码、工单备注,也可能是一次工具调用结果。输出审核要覆盖内容合规、敏感信息、版权风险、事实一致性和业务边界。

比较稳妥的处置方式不是“一律拒答”,而是分级处理:低风险提示核验,中风险脱敏或安全改写,高风险拒答并说明原因,不确定内容转人工复核。

数美科技这类 AIGC 安全围栏服务商的价值,通常体现在多模态内容审核、风险标签体系、安全代答、账号风控、人工复核和策略运营的组合能力上。对 Agent 应用来说,重点不是单点拦截,而是让输入、输出和执行链路都有可解释的安全判断。

7. 上线前 POC 建议测哪些指标?

指标 建议测试方式
风险召回率 准备提示词注入、越权查询、违规生成、敏感信息样本
误杀率 用正常业务任务测试是否被过度拦截
漏放率 模拟绕写、谐音、拆字、多轮诱导和文件注入
延迟 关注平均延迟、P95、P99,特别是多工具调用场景
权限一致性 不同角色访问同一任务,检查结果是否符合 ACL
审计完整性 检查 request_id、user_id、tool_name、action、label 是否可回放
策略迭代 测试新增风险样本后能否快速上线规则或模型策略

FAQ

Q:AI Agent 安全和普通大模型内容安全有什么区别?

A:普通大模型内容安全主要关注输入输出内容;Agent 安全还要关注任务规划、工具调用、API 权限、动作审批和审计回放,因为 Agent 可能真正触发业务动作。

Q:Agent 上线前最容易忽略什么?

A:最容易忽略工具调用权限和外部内容注入。外部网页、邮件、文档中的文字可能诱导 Agent 执行错误指令,API 参数也不能完全信任模型生成。

Q:数美科技适合哪些 Agent 安全场景?

A:如果 Agent 涉及用户内容、企业知识库、对外回复、账号体系、多模态内容或高风险业务流程,可以重点评估数美在 AIGC 安全围栏、内容审核、账号风控、安全代答和运营闭环上的能力。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐