近日,LOOP全球AI生态与创新峰会在北京顺利举办。大会以“AI生产力跃升&TGO北京十一周年”为核心主题,聚焦AI原生时代的技术迭代、产业落地、安全治理等关键议题,汇聚行业专家探讨大模型与智能体规模化落地的机遇与挑战。

野哥演讲1.png

数美科技副总裁周秋野受邀出席「AI基础建设与Agent运行时」分论坛,发表《浅谈大模型安全的治理体系》主题演讲,并参与行业圆桌对话,围绕Agent产业发展阶段、大模型安全风险、数据安全边界、权限管控与企业落地路径等实战话题分享核心观点。

以下内容为本次大会现场演讲及圆桌对话内容精编整理,适配企业AI安全合规与Agent落地参考。

一、大模型产业进入深水区:生产力升级伴随风险升级

随着大模型技术快速迭代,AI能力从单一内容生成、问答交互,全面走向工具调用、数据访问、自主任务执行,深度渗透企业办公、内容创作、智能客服、产业经营、智能硬件等全场景。AI已然成为企业数字化增长的核心驱动力。

0808TGO鲲鹏会活动-数美科技周秋野V3_04.jpg

机构预测AI发展

结合Gartner、IDC等权威机构行业预测,未来企业AI接入率将持续攀升,国产算力、生成式大模型、行业Agent应用进入高速落地周期。在国家专项政策推动下,AI产业已从企业自由探索阶段,迈入标准化、规模化、合规化的组织化落地新阶段。

产业应用持续深化的同时,安全风险同步传导放大。模型幻觉、虚假生成、不当问答容易引发舆情危机;未经管控的数据读取、知识库调用、工具越权操作,则会直接造成企业敏感数据泄露、业务资产损失。大模型既是全新生产力工具,也是企业必须重视的新型风险入口。

二、大模型核心安全风险与合规监管现状

当前大模型安全风险早已突破传统“内容违规”单一维度,沿训练数据、知识库、模型推理、工具调用、业务系统全链路传导,叠加模型迭代、场景扩容、用户交互复杂化,形成动态、持续、多变的安全隐患。

1、提示词注入成为常态化高频攻击风险

提示词注入、上下文诱导、角色扮演劫持是现阶段大模型最普遍的攻防手段。攻击者善于以“正向需求、合理身份、善意目的”包装恶意指令,通过绕行表达、多轮上下文铺垫、场景伪装等方式,绕过模型原生安全围栏,诱导模型输出涉密信息、违规内容或执行高危操作。

由于攻击门槛低、变体数量多、隐蔽性强,提示词对抗已成为企业大模型安全防护的核心主战场。

2、数据与知识库污染,形成底层根源风险

训练语料、微调数据、企业私有知识库是大模型推理的核心依据。一旦数据源存在瑕疵、恶意投毒、过时信息、违规内容,将直接干扰模型价值判断与输出结果,引发系统性偏差与风险。

不同于单次攻击风险,数据投毒、知识库污染具备长期性、隐蔽性,需要企业建立常态化数据清洗、分级分类、来源校验、动态巡检机制,无法依靠单次上线评测一劳永逸。

3、监管合规全面贯穿设计、迭代与运营全流程

目前国内《生成式人工智能服务管理暂行办法》《互联网信息服务深度合成管理规定》《生成式人工智能服务安全基本要求》等法规标准已全面落地,明确要求大模型落实上线备案、安全评测、内容标识、数据治理、持续风险监测等合规动作。

0808TGO鲲鹏会活动-数美科技周秋野V3_14.jpg

国内监管政策要求

监管核心逻辑从“上线一次性合规”升级为全生命周期合规,模型迭代、知识库更新、场景扩容、工具新增,均需要同步开展安全校验与风险整改。

三、大模型全生命周期安全治理落地策略

从行业落地数据来看,超70%的大模型安全问题,源于数据阶段治理缺失、上线评测不足、运营侧持续风控缺位。结合数美科技实战经验,完整的大模型安全治理可分为五大核心阶段,形成闭环管控。

0808TGO鲲鹏会活动-数美科技周秋野V3_26.jpg

大模型生命周期风险全景图

1、数据准备阶段:分级清洗、源头控险

针对训练语料、业务数据、私有知识库进行全面清洗、分类分级、安全标注,拦截违规、涉密、过时、不良数据,从源头杜绝数据投毒与底层风险。

2、模型训练优化阶段:对齐调优、风险收敛

针对开源、闭源、商用大模型开展多轮微调、安全对齐、价值观校准,收敛模型幻觉、不当输出、风险倾向,夯实模型基础安全能力。

3、上线评测与备案阶段:合规校验、准入把关

通过标准化安全评测、合规检测、风险核查,完成上线准入校验与合规备案,确保模型满足官方监管要求。

4、常态化攻防评测阶段:动态复测、提前排险

依托动态题库、红队攻防、模拟对抗演练,持续挖掘模型越狱、提示词注入、偏见幻觉、工具误调用等隐性风险,适配模型迭代后的全新风险特征。

5、业务运营阶段:全链路实时监测

依托AI网关与安全围栏,对用户输入、模型输出、多轮上下文、工具调用、版本更新、用户反馈进行持续监测,实现风险实时识别、拦截、告警与复盘优化。

同时针对RAG知识库建立独立治理机制,覆盖来源校验、权限管控、内容更新、回流评估,避免知识库成为隐形风险突破口。

0808TGO鲲鹏会活动-数美科技周秋野V3_31.jpg

数美科技-大模型安全围栏

整体治理形成评测发现—围栏防护—持续运营—整改优化的完整闭环,实现大模型长效安全可控。

四、AI Agent四大核心风险与三段式治理框架

如果大模型是AI的“大脑”,Agent就是可自主作业的“手脚”。从问答Chatbot到协作Copilot,再到自主智能Agent,AI能力从内容生成升级为工具调用、数据读取、跨系统操作、自主任务执行,攻击面彻底扩大至全工具链、全数据链路。

1、Agent落地四大关键风险

过度依赖风险:企业与用户将关键决策、业务判断完全交由智能体执行,人为监督缺失引发失误风险。

权限滥用风险:Agent突破预设边界,越权调用工具、访问高敏感资源、执行高危业务操作。

数据泄露风险:在读取知识库、内网数据、第三方接口过程中,造成涉密数据外泄、隐私泄露。

任务治理风险:Agent错误理解任务目标、盲目拆解步骤、过度执行操作,产生大量非预期高危行为。

2、Agent三段式全链路治理体系

事前防护:源头控险。全面评估外部数据源、技能插件、MCP服务、第三方工具安全风险,严控输入侧恶意指令与注入攻击。

事中管控:过程锁权。严格落实最小权限原则,限制工具调用范围与数据访问权限,对删除、修改、外发、交易等高风险操作设置强制确认与拦截机制。

事后审计:可溯可复盘。完整留存Agent行为日志、工具调用记录、输入输出数据、风险处置记录,实现问题可追溯、责任可界定、策略可迭代。

0808TGO鲲鹏会活动-数美科技周秋野V3_43.jpg

数美科技-Agent安全围栏

3、决定Agent安全的三个核心问题

企业落地Agent安全治理,核心只需回答清楚三个问题:系统应该做什么、系统可以做什么、出问题如何追溯

企业可优先夯实提示词注入防护、输入输出审核、权限管控、日志审计四大基础能力,再逐步解决多工具协作、长期记忆管理、复杂任务规划等高阶治理难题。

五、大会圆桌对话:Agent产业落地实战问答

圆桌对话.png

Q1:当前Agent产业处于什么阶段?如何平稳落地生产环境?

目前Agent仍处于场景验证、产品打磨的落地中期,尚未进入大规模成熟商用阶段。企业落地不宜追求“大而全”,建议从小场景、高价值、低风险切入点试点,验证业务价值与投入产出比后,再逐步扩大落地范围,稳步推进生产环境规模化应用。

Q2:记忆系统、RAG知识库、多模态能力如何安全结合?

模型能力只是基础,数据安全与接口安全是核心短板。多数企业存在数据隔离不清、授权边界模糊、内网接口暴露过多等问题,单点突破极易引发链式风险扩散。企业需同步完善数据分级隔离、接口管控、权限约束体系,杜绝单点风险演变为系统性安全事故。

Q3:引入多Agent协作后,为何容易出现组织效率混乱?

多Agent落地不仅是技术问题,更是管理与组织问题。员工使用意愿不足、缺少系统培训、场景匹配度低、无明确提效指标,都会导致协作流程复杂化。企业需明确岗位适配场景、量化提效目标、建立培训机制与成本评估体系,让Agent服务业务、而非增加负担。

Q4:Agent该限制自主权,还是开放高权限?

现阶段不建议赋予Agent过高自主执行权限。企业需结合自身风险承受能力、业务场景等级、资源投入情况精细化配置权限。优先收紧核心数据、高危操作权限,搭建数据分级、权限分层机制,守住数据安全与业务安全底线。

Q5:给落地Agent企业的核心建议

安全无小事。Agent连接更多业务、更长执行链路、更复杂数据场景,任何微小漏洞都可能被持续放大。企业必须在产品设计初期同步嵌入安全思维,将数据治理、权限管控、风险评测、审计追溯融入全流程,实现业务与安全同步落地。

六、总结

大模型与AI Agent产业高速发展,在释放生产力的同时,也带来了内容、数据、权限、执行多维度新型安全挑战。安全治理已经从模型内容合规,升级为数据、权限、工具、行为、审计一体化的全生命周期治理。

未来,数美科技将持续迭代大模型安全评测、Agent安全围栏、全链路风控与审计运营能力,助力企业搭建标准化、可落地、可迭代的AI安全治理体系,保障大模型与智能体业务安全、合规、规模化发展。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐