清华大学×UW-Madison:AI Agent越会执行越怕越狱?RePD先拆提示再回答
原论文题名:RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
团队信息:Peiran Wang、Xiaogeng Liu、Chaowei Xiao;Tsinghua University 与 University of Wisconsin–Madison 团队
发表信息:Findings of NAACL 2025,2025,DOI:10.18653/v1/2025.findings-naacl.16
研究对象与核心方法:面向大语言模型越狱攻击防御;通过检索相似攻击模板,把隐藏在用户输入中的有害意图拆出来,再让模型在回答前先中和风险成分。
摘要导读
现实问题:AI Agent 接入工具后,安全风险不只来自模型回答,还来自用户输入能否绕过规则、诱导工具链执行危险步骤。
背景:很多越狱提示并不是直接提出危险请求,而是把真实意图包进角色扮演、模板、编码或自适应攻击里。
方法:RePD 建立攻击模板检索库,每次收到输入后检索相似模板,再把“拆解提示”的过程作为 one-shot 示例放进当前上下文。
结果:论文在多个开源 LLM 上比较 ASR、FPR 和准确率,RePD 与多智能体版本 RePD-M 在降低攻击成功率方面表现突出。
结论:这篇论文的启发是:安全防护不一定只靠更硬的拒答规则,也可以先把复杂提示拆开,让模型看清真正请求。
关键词:AI Agent安全;越狱攻击;提示分解;检索增强防御;RePD;LLM治理
介绍:背景与问题提出
Agent 越能接工具,越需要把输入安全放到系统入口。普通聊天模型答错,影响可能停留在文字层面;工具型 Agent 一旦被诱导,就可能触发检索、写入、调用接口或执行流程,风险链条会更长。
越狱攻击的麻烦在于,它常常不是一句直白的危险请求,而是把真实意图包在模板里:角色扮演、编码、前置故事、多轮诱导、伪装成测试任务。模型如果只看表层文字,很可能无法分辨真正要执行的动作。
RePD 的思路很清楚:既然很多攻击有模板结构,那就先检索相似模板,再教模型把“包装层”和“真实请求”拆开。拆开以后,模型再决定如何处理输入,而不是直接进入回答。

原文图 1:RePD 检索式提示分解框架,每次输入都会与攻击模板库进行匹配,再构造拆解示例。来源:ACL Anthology 官方 PDF 裁图;Findings of NAACL 2025;DOI:10.18653/v1/2025.findings-naacl.16
研究方法
RePD 的流程包括三步。其一,建立攻击模板库,把已收集到的越狱模板作为可检索样本。其二,面对新的用户输入时,系统从库中找出相似模板。其三,把相似模板中的拆解过程作为 one-shot 示例,放进当前提示里,引导模型先识别并分离潜在危险部分。
论文还提出 RePD-M,也就是多智能体版本。单 Agent 版本主要做提示拆解和回答控制;多 Agent 版本进一步把问题拆解和回答拆解分给不同 Agent,希望降低单个模型被同一段攻击提示带偏的可能。
评估时,论文比较了 Self-Reminder、Safe Prompt、GPT Paraphrasing、RePD 和 RePD-M,并在 Vicuna、Llama、Qwen、Llama 3 等模型系列上报告攻击成功率、误报率和准确率。

原文表 1:不同防御方案在多种 LLM 上的 ASR、FPR 与 accuracy 比较。来源:ACL Anthology 官方 PDF 裁图;Findings of NAACL 2025;DOI:10.18653/v1/2025.findings-naacl.16
核心发现与结果解读
其一,检索不是为了补知识,而是为了补“攻击结构记忆”
普通 RAG 多用于补充事实材料,RePD 的检索对象却是攻击模板。这个视角很重要:安全系统需要记住的不只是规则,还包括攻击者常用的包装方式。检索到相似模板后,模型更容易意识到当前输入可能不是表面任务。
其二,提示分解能降低攻击成功率,同时保持正常请求通道
表 1 中可以看到,RePD 和 RePD-M 在多个模型上把 ASR 压到较低水平。例如 Llama-2-7B 上,RePD-M 报告 ASR/FPR/accuracy 为 0.02/0.00/0.99;Llama-2-70B 上为 0.01/0.00/1.00。它不是简单把所有可疑输入都挡掉,而是通过拆解降低攻击成功概率。
其三,多 Agent 防线更强,但会带来时延成本
论文报告,多智能体 RePD-M 相比单 Agent RePD 在 ASR 上提升 24.3%,在 FPR 上提升 31.2%;代价是平均时间成本增加 104.21%。这给企业落地一个现实提醒:安全层可以更强,但必须结合场景选择入口过滤、分级处理和高风险任务复核。

原文图 2:不同防御框架在不同攻击类型上的效果比较。来源:ACL Anthology 官方 PDF 裁图;Findings of NAACL 2025;DOI:10.18653/v1/2025.findings-naacl.16
创新点与学术价值
RePD 的亮点在于把安全防御从“单句拒答”推进到“先拆结构,再判断意图”。它承认攻击提示本身是一种可学习、可检索、可迁移的文本结构,因此用检索来寻找相似结构,用 one-shot 示例来引导模型识别包装层。
在 Agent 安全治理框架里,这类工作给出一个清晰分层:入口过滤、模板检索、提示分解、工具权限、日志审计和人工复核应该形成闭环,而不是只靠系统提示词挡风险。
局限性与未来方向
论文也有清晰边界。RePD 依赖攻击模板库,面对完全新型攻击时仍可能失效;多智能体版本虽然更稳,但会增加时延和计算成本。实际系统还需要结合权限隔离、工具白名单、输出审查和运行时监控。
另外,论文主要评估文本输入层面的越狱防御。Agent 真实落地时还会遇到网页注入、文档注入、检索污染和工具返回内容污染,这些攻击路径需要更长链路的防护设计。
证据链回看
这篇论文可以用一条链条来理解:用户输入并不直接进入回答,而是先与攻击模板库相似匹配,再生成拆解示例,再让模型分离有害意图,随后才进入回答或拒绝环节。
真正值得带走的不是某个具体提示词,而是一种架构思想:安全层应该具备“识别包装结构”的能力。对于接工具的 Agent,这一步可能比单纯扩写系统提示更接近工程可控。
结语
AI Agent 正在从聊天窗口走向执行系统,输入安全也必须从口号变成流程。RePD 提醒我们:要让 Agent 更可靠,先别急着回答,先把用户输入拆开看清楚。
参考文献
Wang P, Liu X, Xiao C. RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process. Findings of NAACL 2025. DOI: 10.18653/v1/2025.findings-naacl.16.
更多推荐

所有评论(0)