AI Agent安全危机再发酵:你的“数字员工”,可能正在被利用
这两个月,一个很明显的变化是:
大家讨论 AI Agent,已经不再只问它“能不能干活”,而开始问它一句更现实的话——它会不会被别人借来干坏事?
这不是危言耸听。
如果把大模型当聊天工具,风险当然有,但大多还停留在“回答错了”“胡说了”“泄露了一点信息”这一层。可一旦你把它升级成 Agent,情况就变了。
因为 Agent 不只是会回答。
它还会读文档、连邮箱、调接口、查数据库、执行工具、触发流程、代替人去做一部分操作。说白了,它开始有手有脚了。
而一个系统只要既能理解内容,又能调用工具,还能碰到真实业务数据,它面对的就不再只是“模型效果”问题,而是标准的安全系统问题。
很多企业还没完全意识到这点。他们以为自己部署的是一个“聪明一点的数字员工”,实际引进来的,可能是一个权限很大、判断不稳、还特别容易被外部内容带偏的执行代理。
问题就出在这里。
AI Agent 最大的风险,不是它不会做事,而是它会在你没意识到的时候,替别人做事。
一、为什么 Agent 的安全问题,比普通大模型更危险
普通大模型最常见的问题,是“说错”。Agent 最麻烦的问题,是“做错”。
这两个不是一个量级。
一个客服机器人回答错一段话,最多是体验差;一个接了知识库、邮件、审批流、数据库查询和外部工具的 Agent,一旦被诱导,它可能真的会:
- 调错接口
- 暴露内部信息
- 访问不该访问的资源
- 执行错误操作
- 把错误结果继续写回系统
这就不是“内容生成失误”了,而是行为层失控。
从安全视角看,Agent 比传统 LLM 多了三层风险放大器:
1)它接入了真实环境
它读到的不再只是提示词,而是网页、附件、内部文档、IM 消息、工单、知识库、数据库查询结果。
2)它拥有执行能力
它不只是输出文字,还可能调工具、跑动作、发请求、写状态。
3)它天然跨系统
一个 Agent 往往连着多个工具、多份数据、多个账号体系。只要有一个环节被带偏,后面整条链都可能跟着出问题。
所以,安全问题一旦落到 Agent 身上,性质就变了:
它不是“模型被攻击”,而是“企业流程被借道”。

二、现在最值得警惕的,不是一个 bug,而是三类系统性风险
如果你最近在关注 Agent 安全,会发现很多案例表面不一样,底层其实都能归到几类成熟风险模型里。
这里不讲太虚的,直接说企业最该盯住的三类。
三、第一类风险:提示词注入,已经从“骗模型”升级成“借模型做事”
很多人第一次听提示词注入,会以为这只是“让模型输出一句奇怪的话”。那是早期理解。
现在真正危险的,不是让模型说错,而是让它改执行意图。
比如一个 Agent 本来要帮你做这些事:
- 阅读一封邮件并总结重点
- 从附件里提取待办
- 查询 CRM 补全客户资料
- 生成回复建议
- 通过工具把草稿回写到系统
看起来很顺。
但问题是,邮件、附件、网页、共享文档这些输入,本身可能就带着隐藏指令。这些指令对人未必显眼,对 Agent 却可能是“高优先级任务”。
于是就会出现一种很危险的情况:
用户要它做 A,外部内容偷偷让它做 B,它最后真去做了 B。
这就是为什么现在越来越多安全资料强调“间接提示词注入”。不是你直接对模型下命令,而是把恶意指令藏在它要读的内容里,等它自己吞进去。
这件事最可怕的地方,不在“被诱导回答错误”,而在于它可能真的触发后续动作:
- 把内部信息拼进回传内容
- 忽略原始任务目标
- 调用不必要的工具
- 把错误结论写进业务流程
- 把攻击链继续传给下游系统
很多团队低估这件事,是因为他们默认“输入内容只是数据”。但对 Agent 来说,输入内容同时也是指令载体。
只要这点没想明白,系统迟早出问题。

四、第二类风险:工具链和技能供应链,正在成为新的薄弱环节
很多企业现在做 Agent,不会从零写所有能力。他们通常会接第三方插件、内部封装工具、脚本能力、工作流组件、检索模块和外部 API。
这样做效率很高,但也埋下了另一个问题:
你以为自己在管理一个 Agent,实际上你在管理一串会被它调用的能力网络。
这条链里,只要有一个环节边界不清、鉴权松、返回数据不可信,或者能力描述本身有误导,风险就会被放大。
最典型的问题有几种:
1)工具描述写得过于宽泛
模型一看描述,误以为这个工具“什么都能查、什么都能改”,于是滥用。
2)工具权限和业务权限没有拆开
员工本人只能看 A 数据,但 Agent 绑定的服务账号却能碰到 B、C、D,结果代理权限反而比人更大。
3)返回结果未经校验就进入下一轮决策
上游工具给错了、被污染了、字段异常了,Agent 还拿它当真,再继续往后执行。
4)插件和脚本来源杂
你觉得只是“加个能力”,实际上等于把一段外部逻辑直接接进了核心执行链。
这就是为什么现在谈 Agent 安全,不能只盯模型本身。真正的攻击面,很多时候根本不在模型,而在模型周围那圈工具链。
模型只是决策中枢。真正把风险落地成事故的,往往是那些“它可以调”的东西。
五、第三类风险:权限过大,正在把 Agent 变成高危中间人
很多团队做 Agent,会先追求“好用”。为了让它一步到位,他们喜欢给它开很多权限:
- 能搜内部资料
- 能读历史记录
- 能调多个业务接口
- 能帮忙创建、修改、同步、发送
- 能跨系统串联流程
短期看,这样体验很好。长期看,这很危险。
因为 Agent 和普通员工有个本质差别:
员工知道自己什么时候不确定,Agent 不一定。
它可能会犹豫,但它也可能在高不确定状态下,仍然继续执行。尤其当系统默认“能调工具就先调、能返回结果就先返回”的时候,风险会进一步放大。
更麻烦的是,Agent 的权限经常不是按“最小可用”设计的,而是按“功能最完整”设计的。这就导致一个极其危险的局面:
一个原本只是想提升效率的助手,最终拥有了不成比例的访问和操作能力。
一旦再叠加前面的提示词注入、工具链污染,结果就很直接:
- 被骗得更快
- 错得更深
- 影响范围更大
- 追责更困难
很多企业现在真正该担心的,不是 Agent 不够聪明,而是它太早拿到了不该拿的能力。
六、为什么这波风险会集中爆出来?因为 Agent 已经从“会聊”走到了“会动”
过去两年,大模型的关注点一直偏向生成能力。大家看的是:
- 写得像不像
- 回得快不快
- 理解得准不准
现在进入 Agent 阶段,关注点自然会转向执行能力。而只要系统开始执行,安全问题就一定抬头。
这波风险升温,不是偶然,背后有三个现实原因。
1)越来越多企业开始让 Agent 接真实业务
不是实验室 demo 了,而是开始碰工单、知识库、客服、销售、研发、审批这些真实流程。
2)外部内容正在大量进入 Agent 上下文
网页、邮件、附件、PDF、会议纪要、聊天记录,都是潜在输入源。输入源一复杂,攻击面就上来了。
3)很多团队还在用“做聊天机器人”的思路做 Agent
他们把重点放在模型效果,却没有同步补上权限设计、输入隔离、工具白名单、审计链路和人工确认机制。
于是就出现一个错位:
能力已经升级了,安全设计还停在上一代。
这才是现在最危险的地方。
七、企业现在最该做的,不是恐慌下线,而是立刻补这 6 道防线
如果你们团队已经在上 Agent,我不建议一上来就喊停。Agent 不是不能用,而是不能按聊天工具的安全标准去用。
下面这 6 条,是现在最值得马上补的。
1)把“输入”当成不可信对象,不要当成天然数据
网页、邮件、附件、知识库切片、第三方文档,都应该默认带风险。不要因为它长得像资料,就认为它只是资料。
2)把工具调用做成白名单,不要让模型自由发挥
Agent 能调用哪些工具、什么场景能调、调之前需要什么条件,必须写死一层,不要全交给模型自己判断。
3)权限按最小可用拆分,不要图省事给大号
能只读就别给写。能查摘要就别给查明文。能限单系统就别跨系统。尤其不要让 Agent 绑定一个“全能服务账号”。
4)高风险动作必须人工确认
涉及发消息、改状态、写回系统、调用关键接口、下载导出、批量操作的,都应该有确认闸门。
5)所有关键链路都要留审计记录
至少要知道:
- 它读了什么
- 为什么做这个判断
- 调了哪个工具
- 工具返回了什么
- 最终动作是谁批准的
没有这条,出了事根本没法复盘。
6)先做小闭环,不要一上来全业务接入
不要一开始就让一个 Agent 管太多事。先选一个高频但低风险场景,做最小能力集合,把安全策略跑顺,再扩。

八、给管理层一个更直接的判断:AI Agent 已经进入“能创造价值,也能放大事故”的阶段
很多管理层现在问:Agent 值不值得上?
我的判断是:值得。但另一个判断同样重要:
它已经不再是“新工具试试水”的阶段,而是“必须按生产系统治理”的阶段。
这意味着什么?
意味着你不能只看两个指标:
- 效率有没有提升
- 人力有没有节省
你还得同时看另外两个指标:
- 它会不会扩大错误
- 它会不会引入新的攻击入口
如果一个 Agent 每天帮你节省 3 小时,但同时把高权限、外部输入、跨系统执行和弱审计绑在一起,那它带来的就不是单纯效率红利,而是一个正在长大的系统性风险点。
很多企业今年真正要补的课,不是“要不要做 Agent”,而是:
当 Agent 成为数字员工之后,你有没有把它按员工、按系统、按攻击面来管理。
这三个视角,缺一个都不行。
九、最后:最怕的不是 Agent 不够聪明,而是它在错误的边界里越来越能干
AI Agent 会越来越强,这件事基本已经不用讨论。真正要讨论的是:
它变强以后,是在谁划定的边界里工作。
如果边界清楚、权限收敛、输入隔离、审计完整、关键动作可控,它就是生产力。
如果这些都没做好,它越能干,风险越大。
未来企业真正要防的,不是“AI 不会工作”,而是“AI 在错误授权下替别人工作”。
这不是科幻,而是 Agent 进入真实业务之后,已经摆在台面上的安全问题。
更多推荐


所有评论(0)