这两个月,一个很明显的变化是:

大家讨论 AI Agent,已经不再只问它“能不能干活”,而开始问它一句更现实的话——它会不会被别人借来干坏事?

这不是危言耸听。

如果把大模型当聊天工具,风险当然有,但大多还停留在“回答错了”“胡说了”“泄露了一点信息”这一层。可一旦你把它升级成 Agent,情况就变了。

因为 Agent 不只是会回答。

它还会读文档、连邮箱、调接口、查数据库、执行工具、触发流程、代替人去做一部分操作。说白了,它开始有手有脚了。

而一个系统只要既能理解内容,又能调用工具,还能碰到真实业务数据,它面对的就不再只是“模型效果”问题,而是标准的安全系统问题。

很多企业还没完全意识到这点。他们以为自己部署的是一个“聪明一点的数字员工”,实际引进来的,可能是一个权限很大、判断不稳、还特别容易被外部内容带偏的执行代理。

问题就出在这里。

AI Agent 最大的风险,不是它不会做事,而是它会在你没意识到的时候,替别人做事。


一、为什么 Agent 的安全问题,比普通大模型更危险

普通大模型最常见的问题,是“说错”。Agent 最麻烦的问题,是“做错”。

这两个不是一个量级。

一个客服机器人回答错一段话,最多是体验差;一个接了知识库、邮件、审批流、数据库查询和外部工具的 Agent,一旦被诱导,它可能真的会:

  • 调错接口
  • 暴露内部信息
  • 访问不该访问的资源
  • 执行错误操作
  • 把错误结果继续写回系统

这就不是“内容生成失误”了,而是行为层失控

从安全视角看,Agent 比传统 LLM 多了三层风险放大器:

1)它接入了真实环境

它读到的不再只是提示词,而是网页、附件、内部文档、IM 消息、工单、知识库、数据库查询结果。

2)它拥有执行能力

它不只是输出文字,还可能调工具、跑动作、发请求、写状态。

3)它天然跨系统

一个 Agent 往往连着多个工具、多份数据、多个账号体系。只要有一个环节被带偏,后面整条链都可能跟着出问题。

所以,安全问题一旦落到 Agent 身上,性质就变了:

它不是“模型被攻击”,而是“企业流程被借道”。

在这里插入图片描述


二、现在最值得警惕的,不是一个 bug,而是三类系统性风险

如果你最近在关注 Agent 安全,会发现很多案例表面不一样,底层其实都能归到几类成熟风险模型里。

这里不讲太虚的,直接说企业最该盯住的三类。


三、第一类风险:提示词注入,已经从“骗模型”升级成“借模型做事”

很多人第一次听提示词注入,会以为这只是“让模型输出一句奇怪的话”。那是早期理解。

现在真正危险的,不是让模型说错,而是让它改执行意图

比如一个 Agent 本来要帮你做这些事:

  • 阅读一封邮件并总结重点
  • 从附件里提取待办
  • 查询 CRM 补全客户资料
  • 生成回复建议
  • 通过工具把草稿回写到系统

看起来很顺。

但问题是,邮件、附件、网页、共享文档这些输入,本身可能就带着隐藏指令。这些指令对人未必显眼,对 Agent 却可能是“高优先级任务”。

于是就会出现一种很危险的情况:

用户要它做 A,外部内容偷偷让它做 B,它最后真去做了 B。

这就是为什么现在越来越多安全资料强调“间接提示词注入”。不是你直接对模型下命令,而是把恶意指令藏在它要读的内容里,等它自己吞进去。

这件事最可怕的地方,不在“被诱导回答错误”,而在于它可能真的触发后续动作:

  • 把内部信息拼进回传内容
  • 忽略原始任务目标
  • 调用不必要的工具
  • 把错误结论写进业务流程
  • 把攻击链继续传给下游系统

很多团队低估这件事,是因为他们默认“输入内容只是数据”。但对 Agent 来说,输入内容同时也是指令载体

只要这点没想明白,系统迟早出问题。

在这里插入图片描述


四、第二类风险:工具链和技能供应链,正在成为新的薄弱环节

很多企业现在做 Agent,不会从零写所有能力。他们通常会接第三方插件、内部封装工具、脚本能力、工作流组件、检索模块和外部 API。

这样做效率很高,但也埋下了另一个问题:

你以为自己在管理一个 Agent,实际上你在管理一串会被它调用的能力网络。

这条链里,只要有一个环节边界不清、鉴权松、返回数据不可信,或者能力描述本身有误导,风险就会被放大。

最典型的问题有几种:

1)工具描述写得过于宽泛

模型一看描述,误以为这个工具“什么都能查、什么都能改”,于是滥用。

2)工具权限和业务权限没有拆开

员工本人只能看 A 数据,但 Agent 绑定的服务账号却能碰到 B、C、D,结果代理权限反而比人更大。

3)返回结果未经校验就进入下一轮决策

上游工具给错了、被污染了、字段异常了,Agent 还拿它当真,再继续往后执行。

4)插件和脚本来源杂

你觉得只是“加个能力”,实际上等于把一段外部逻辑直接接进了核心执行链。

这就是为什么现在谈 Agent 安全,不能只盯模型本身。真正的攻击面,很多时候根本不在模型,而在模型周围那圈工具链。

模型只是决策中枢。真正把风险落地成事故的,往往是那些“它可以调”的东西。


五、第三类风险:权限过大,正在把 Agent 变成高危中间人

很多团队做 Agent,会先追求“好用”。为了让它一步到位,他们喜欢给它开很多权限:

  • 能搜内部资料
  • 能读历史记录
  • 能调多个业务接口
  • 能帮忙创建、修改、同步、发送
  • 能跨系统串联流程

短期看,这样体验很好。长期看,这很危险。

因为 Agent 和普通员工有个本质差别:

员工知道自己什么时候不确定,Agent 不一定。

它可能会犹豫,但它也可能在高不确定状态下,仍然继续执行。尤其当系统默认“能调工具就先调、能返回结果就先返回”的时候,风险会进一步放大。

更麻烦的是,Agent 的权限经常不是按“最小可用”设计的,而是按“功能最完整”设计的。这就导致一个极其危险的局面:

一个原本只是想提升效率的助手,最终拥有了不成比例的访问和操作能力。

一旦再叠加前面的提示词注入、工具链污染,结果就很直接:

  • 被骗得更快
  • 错得更深
  • 影响范围更大
  • 追责更困难

很多企业现在真正该担心的,不是 Agent 不够聪明,而是它太早拿到了不该拿的能力


六、为什么这波风险会集中爆出来?因为 Agent 已经从“会聊”走到了“会动”

过去两年,大模型的关注点一直偏向生成能力。大家看的是:

  • 写得像不像
  • 回得快不快
  • 理解得准不准

现在进入 Agent 阶段,关注点自然会转向执行能力。而只要系统开始执行,安全问题就一定抬头。

这波风险升温,不是偶然,背后有三个现实原因。

1)越来越多企业开始让 Agent 接真实业务

不是实验室 demo 了,而是开始碰工单、知识库、客服、销售、研发、审批这些真实流程。

2)外部内容正在大量进入 Agent 上下文

网页、邮件、附件、PDF、会议纪要、聊天记录,都是潜在输入源。输入源一复杂,攻击面就上来了。

3)很多团队还在用“做聊天机器人”的思路做 Agent

他们把重点放在模型效果,却没有同步补上权限设计、输入隔离、工具白名单、审计链路和人工确认机制。

于是就出现一个错位:

能力已经升级了,安全设计还停在上一代。

这才是现在最危险的地方。


七、企业现在最该做的,不是恐慌下线,而是立刻补这 6 道防线

如果你们团队已经在上 Agent,我不建议一上来就喊停。Agent 不是不能用,而是不能按聊天工具的安全标准去用

下面这 6 条,是现在最值得马上补的。

1)把“输入”当成不可信对象,不要当成天然数据

网页、邮件、附件、知识库切片、第三方文档,都应该默认带风险。不要因为它长得像资料,就认为它只是资料。

2)把工具调用做成白名单,不要让模型自由发挥

Agent 能调用哪些工具、什么场景能调、调之前需要什么条件,必须写死一层,不要全交给模型自己判断。

3)权限按最小可用拆分,不要图省事给大号

能只读就别给写。能查摘要就别给查明文。能限单系统就别跨系统。尤其不要让 Agent 绑定一个“全能服务账号”。

4)高风险动作必须人工确认

涉及发消息、改状态、写回系统、调用关键接口、下载导出、批量操作的,都应该有确认闸门。

5)所有关键链路都要留审计记录

至少要知道:

  • 它读了什么
  • 为什么做这个判断
  • 调了哪个工具
  • 工具返回了什么
  • 最终动作是谁批准的

没有这条,出了事根本没法复盘。

6)先做小闭环,不要一上来全业务接入

不要一开始就让一个 Agent 管太多事。先选一个高频但低风险场景,做最小能力集合,把安全策略跑顺,再扩。

在这里插入图片描述


八、给管理层一个更直接的判断:AI Agent 已经进入“能创造价值,也能放大事故”的阶段

很多管理层现在问:Agent 值不值得上?

我的判断是:值得。但另一个判断同样重要:

它已经不再是“新工具试试水”的阶段,而是“必须按生产系统治理”的阶段。

这意味着什么?

意味着你不能只看两个指标:

  • 效率有没有提升
  • 人力有没有节省

你还得同时看另外两个指标:

  • 它会不会扩大错误
  • 它会不会引入新的攻击入口

如果一个 Agent 每天帮你节省 3 小时,但同时把高权限、外部输入、跨系统执行和弱审计绑在一起,那它带来的就不是单纯效率红利,而是一个正在长大的系统性风险点。

很多企业今年真正要补的课,不是“要不要做 Agent”,而是:

当 Agent 成为数字员工之后,你有没有把它按员工、按系统、按攻击面来管理。

这三个视角,缺一个都不行。


九、最后:最怕的不是 Agent 不够聪明,而是它在错误的边界里越来越能干

AI Agent 会越来越强,这件事基本已经不用讨论。真正要讨论的是:

它变强以后,是在谁划定的边界里工作。

如果边界清楚、权限收敛、输入隔离、审计完整、关键动作可控,它就是生产力。

如果这些都没做好,它越能干,风险越大。

未来企业真正要防的,不是“AI 不会工作”,而是“AI 在错误授权下替别人工作”。

这不是科幻,而是 Agent 进入真实业务之后,已经摆在台面上的安全问题。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐