论文<HiFi-RAG: Hierarchical Content Filtering and Two-Pass Generation for Open-Domain RAG>,强化过滤+排序过程,搜索效果超越Gemini,非常好的实现思路,显著提升rag问答效果。通过将 Gemini 2.5 Flash 应用于高吞吐量的过滤任务,同时将 Gemini 2.5 Pro 的算力集中用于推理环节,我们实现了成本、延迟与准确性的平衡

作者给出了完整的提示词,并且发现Dspy等提示词优化工具有时候并不能提升效果。个人认为,“章节过滤与排序”还可以做的更细致一些,例如通过bm25算法选出候选段落中最相关的句子、参照2.4 双阶段生成的第一步等;“2.5 事后引用验证”可以优化,也罢传统算法用起来,降低模型上下文长度,提高引用内容准确度;

HiFi-RAG:面向开放域检索增强生成的分层内容过滤与双阶段生成

摘要

开放域场景下的检索增强生成(Retrieval-Augmented Generation, RAG)面临两大核心挑战:检索文档中存在无关信息,以及生成答案与用户意图的对齐问题。本文提出HiFi-RAG(分层过滤检索增强生成,Hierarchical Filtering RAG)——该系统在MMU-RAGent NeurIPS 2025竞赛的文本到文本静态评估中斩获闭源系统冠军。我们的方案突破了传统基于嵌入的检索模式,构建了多阶段处理流水线:利用Gemini 2.5 Flash的高效性与成本优势(比Pro版本便宜4-6倍),完成查询构建、分层内容过滤与引用归因任务;同时将Gemini 2.5 Pro的推理能力留作最终答案生成。在MMU-RAGent验证集上,该系统性能超越基线模型,ROUGE-L指标提升至0.274(+19.6%),DeBERTaScore指标提升至0.677(+6.2%)。在自定义数据集Test2025(专门评估2025年1月后新出现知识的相关问题)上,HiFi-RAG相对参数基线模型的ROUGE-L提升57.4%,DeBERTaScore提升14.9%。

1 引言

MMU-RAGent(大规模多模态用户中心检索增强生成基准)竞赛要求参赛者构建能够从网络级语料库中检索信息,以回答各类用户查询的系统。此类系统的一个常见失效模式是检索到无关上下文,进而导致生成内容出现幻觉(即“垃圾输入,垃圾输出”)。

我们的解决方案HiFi-RAG以上下文窗口的精准性为核心优先级,摒弃了传统的向量相似度搜索,转而采用分层过滤策略。类似于多阶段机器学习模型级联架构——利用低算力信号控制高算力处理的触发[8],我们将Gemini 2.5 Flash[2]用作轻量级“守门人”:在将网络内容转发至计算成本更高的Gemini 2.5 Pro之前,先对经过分层解析的网络内容进行语义过滤。这一设计确保深度推理模型仅接收最关键的信息,从而显著降低计算负载。

2 方法论

我们的处理流水线包含五个独立阶段:查询规划(Query Planning)、检索(Retrieval)、分层过滤(Hierarchical Filtering)、双阶段生成(Two-Pass Generation)与引用验证(Citation Verification)。

2.1 查询构建

用户查询往往过于冗长或口语化,难以直接用于高效检索(例如,要求“简单易懂的解释”)。我们利用Gemini 2.5 Flash分析用户意图,并生成优化后的搜索查询。我们明确指示模型“创建高效简洁的谷歌搜索查询”(完整提示词见附录A.1)。如表1所示,基于MMU-RAGent验证集的样本结果,该步骤能够提取核心意图与明确检索词,提升复杂约束条件下的召回率。

表1:查询构建示例(输入源自MMU-RAGent验证集)

用户原始输入 生成的搜索查询
作为一名拥有20年经验的媒体技术教授,请像给五岁小孩解释一样,告诉我相机是如何工作的。 [‘相机工作原理 五岁小孩易懂解释’, ‘ELI5 相机工作原理(注:ELI5即“像给五岁小孩解释一样”)’]
如何将10把四英尺高的椅子垂直堆叠并保持稳定? [‘安全堆叠椅子的方法’, ‘稳定堆叠椅子的技巧’]
告诉我《办公室》(The Office)和《摩登家庭》(Modern Family)在演员直视镜头这一点上的区别。 [‘《办公室》《摩登家庭》演员直视镜头差异’, ‘《办公室》《摩登家庭》打破第四面墙对比’]

2.2 检索与URL过滤

获取谷歌搜索API的初始结果后,我们执行预抓取过滤步骤。并非对所有结果进行爬取,而是利用Gemini Flash分析搜索API返回的URL、标题与预览内容,仅筛选出最相关的来源(详见附录A.2)。该过程使URL数量平均减少33.5%(基于100条查询统计)。通过在高成本爬取前主动剔除无关域名(例如,游戏领域与航空航天领域不匹配的结果)、过时信息、上下文不符内容、缺失关键约束条件的结果及推测性讨论,我们同时提升了系统延迟性能与上下文质量。

2.3 分层内容解析与过滤

分层内容解析

我们利用Scrapingdog API(用于网页)和Reddit API(用于论坛)处理内容的结构复杂性:

  • 分层解析:不将内容视为扁平文本,而是将HTML解析为分层章节(块)。文本块被明确归类至其父级标题下(例如h1–h4标签对应的标题),并以Markdown纯文本格式呈现。
  • Reddit对话树重建:通过获取两层嵌套的Top-k条评论及每条评论的Top-m条回复(k=5,m₁=3,m₂=2),保留讨论流程的连贯性。
章节过滤与排序(大语言模型重排)

不同于基于嵌入的过滤方式,我们部署Gemini 2.5 Flash,仅利用每个解析章节的标题和简短片段(内容前200个字符),对章节与用户查询的相关性进行评估——尽可能降低计算开销。模型通过自定义提示词(见附录A.3)对章节按相关性排序,并剔除噪声信息。该步骤平均移除60.5%的文本块(基于100条查询统计),最终得到高密度、高质量信号的上下文窗口。

2.4 双阶段生成(基于Gemini Pro)

我们通过Gemini 2.5 Pro的两轮对话,分离事实准确性与表达风格的优化(详见附录A.4):

  1. 第一轮(草稿生成):模型基于过滤后的内容生成全面答案,每条来源信息包含标题、URL、预览及按大语言模型评估相关性排序的过滤后章节。
  2. 第二轮(优化精炼):提示模型参考三条从验证集中精心挑选的问答示例(与评估所用的前100组数据无关),调整答案的风格与长度(例如,针对“如何做”类问题提供分步指南)。

2.5 事后引用验证

为确保引用归因的准确性,我们专门利用Gemini 2.5 Flash执行验证步骤。我们将引用生成与答案生成解耦,避免长上下文窗口导致答案质量与引用准确性双双下降。这一设计使验证步骤能够专注于来源归因,并在存在重复信息时优先选择高质量来源(见附录A.5),最终提供与答案主张直接相关的来源上下文索引。

3 实验与结果

3.1 实验设置

竞赛方提供了含真实标签的官方验证集,但未提供训练集,最终测试集为无答案的盲测集。因此,我们采用小样本学习(few-shot)方法,并将MMU-RAGent文本到文本验证集作为主要开发基准。在消融实验阶段,受成本与时间限制,我们仅基于前100个样本(共300个)进行评估。评估指标采用ROUGE-L[6]与DeBERTaScore[3],其中DeBERTaScore选用“microsoft/deberta-xlarge-mnli”模型[7],以确保语义匹配的鲁棒性。

此外,我们在自定义数据集Test2025(含100个样本)上进行了评估。该数据集专门用于测试2025年2月后发生事件的检索性能,严格限定模型必须依赖检索到的上下文,而非参数化记忆(模型预训练时固化的知识)。

3.2 主要结果(标准验证集)

我们通过消融实验量化了流水线各组件的影响,表2总结了性能变化过程。

对于基准模型Q(原始查询,Baseline Q)配置,我们直接将用户查询输入Gemini Pro,并添加字数限制以确保与真实标签的公平对比,提示词为:“请将答案限制在200字以内。[用户查询]”。

表2:MMU-RAGent标准验证集消融实验结果

系统配置 ROUGE-L(F1值) DeBERTaScore(F1值)
基准Q(原始查询+字数限制) 0.2291 0.6375
基准提示词(无搜索) 0.2591 0.6667
检索增强生成(启用搜索) 0.2664 0.6677
带过滤器的检索增强生成(URL+文本块过滤) 0.2695 0.6712
最终配置(带过滤器的检索增强生成+查询重写+双阶段生成) 0.2739 0.6772

最终配置相较于基准模型,ROUGE-L提升19.6%,DeBERTaScore提升6.2%。值得注意的是,仅通过提示词工程(基准提示词配置)就使ROUGE-L显著提升13%,这凸显了指令清晰度的重要性。添加搜索功能(检索增强生成)与主动过滤机制(过滤器)后,性能再提升4%,而完整的双阶段优化系统在所有指标上均取得最佳成绩。

3.3 未来事件检索评估(Test2025数据集)

为严格评估系统的检索能力而非参数化记忆,我们通过Gemini 3.0(带网络搜索的思考模式)生成了Test2025数据集,包含2025年2月后公开知识的问答对。需说明的是,截至2025年11月,本系统使用的Gemini 2.5 Pro、Gemini 2.5 Flash以及Gemini 3.0,其知识截止日期均为2025年1月。

在该数据集上,基准模型Q的性能显著下降(ROUGE-L为0.2022)。因此,启用网络语料库的检索增强生成配置与未启用搜索的基准模型Q之间的性能差距大幅扩大:从MMU-RAGent验证集上的16.3%增至Test2025数据集上的44.16%,这证实了知识截止日期带来的局限性。

我们的检索增强生成系列配置恢复了系统性能,有效弥补了与当前知识的差距。相较于基准模型,ROUGE-L提升57.4%,DeBERTaScore提升14.9%。在最终测试中,我们将原本源自验证集的三个小样本示例替换为Gemini 3.0生成的新示例,以确保答案风格与测试集分布一致。

表3:Test2025数据集性能(2025年2月后未来事件)

系统配置 ROUGE-L(F1值) DeBERTaScore(F1值)
基准Q(原始查询) 0.2022 0.6173
基准提示词(无搜索) 0.2766 0.6574
检索增强生成(启用搜索) 0.2915 0.6776
仅含URL过滤的检索增强生成 0.2966 0.6829
带过滤器的检索增强生成(URL+文本块过滤) 0.3031 0.6840
带过滤器+查询重写的检索增强生成 0.2898 0.6832
最终配置(带过滤器的检索增强生成+查询重写+双阶段生成) 0.3182 0.7092

此外,我们观察到,仅进行查询重写而不启用URL过滤(带过滤器+查询重写的检索增强生成配置)会导致分数下降,这可能是因为冗长查询中的上下文被移除后引入了歧义。而URL过滤能够缓解此类误差,因此查询优化与过滤机制结合使用时效果最佳。

3.4 负面结果

我们探索了多种因性能不佳或成本过高而被舍弃的替代策略:

  • 嵌入过滤vs大语言模型过滤:尝试使用句子嵌入(Voyage AI[9])进行内容过滤,但效果劣于基于大语言模型的过滤。这可能是因为嵌入技术难以区分主题相关但事实无关的噪声信息。
  • 智能体工作流:实现了带搜索工具的完整Gemini智能体。该方案成本高出10倍,且速度显著变慢,常出现超时问题,同时未提升ROUGE分数,性能不及我们的确定性流水线。
  • DSPy优化:使用DSPy[4]结合GEPA进化优化器[1]进行提示词调优。优化器易过拟合验证集,生成的提示词鲁棒性差,无法泛化到其他场景。
  • 大语言模型作为评判者的优化:引入“检查器”模块对答案进行评审,以检测幻觉。尽管答案质量在定性层面有所提升,但自动化指标(ROUGE/DeBERTaScore)反而下降,这可能是因为该模块过度修改表述,导致与参考文本偏差过大。

4 结论

HiFi-RAG 系统的实践表明,在开放域检索增强生成(RAG)任务中,采用结构化的多阶段流水线架构,结合大语言模型(LLMs)进行过滤与生成,其性能优于传统的智能体(agentic)方法。通过将 Gemini 2.5 Flash 应用于高吞吐量的过滤任务,同时将 Gemini 2.5 Pro 的算力集中用于推理环节,我们实现了成本、延迟与准确性的平衡,该方案能够很好地适配 MMU-RAGent 基准测试的需求。

附录A 提示词

A.1 查询优化提示词

我们向Gemini 2.5 Flash输入以下指令,将用户查询转换为适合搜索引擎的关键词:
为该问题创建高效简洁的谷歌搜索查询:
[用户问题]
返回包含1-2个最佳搜索查询的JSON字符串列表。

A.2 URL过滤提示词

爬取前,我们使用Gemini 2.5 Flash通过以下提示词过滤搜索结果,筛选高价值目标:
以下列表中的哪些URL有助于进一步阅读以回答
“[用户问题]”?
请返回URL字符串的JSON列表。以下是包含预览内容的URL:
[搜索结果]

A.3 文本块过滤与排序提示词

以下提示词用于根据标题和内容预览筛选相关章节:
给定网页预览、章节标题及开头片段,请判断哪些章节有助于进一步阅读以
解答[用户问题],无需额外搜索/研究。返回有用章节索引的JSON列表,按实用性从高到低排序。
示例输出:[3, 2, 6, 7]
网页概述:[网页预览内容]
页面中的章节预览:[章节预览内容]
有用的文本块:

A.4 双阶段生成提示词

第一轮(草稿生成):

你是一位乐于助人、知识渊博的助手。用纯文本以一个段落(1-4句话)回答用户问题。仅包含答案本身,无需任何引言、对话填充内容或开场白。
用户问题:[用户问题]
----------- 以下是来自网络搜索的补充信息,可能对你有帮助:[网络内容]
[用户问题]

第二轮(优化精炼):

修改你的答案,使其风格和长度与以下示例中的“答案”保持一致:
[验证集示例]

A.5 引用验证提示词

我们通过单独的大语言模型调用提取引用,确保引用严格支持生成的答案:
阅读答案并识别哪些来源(按[编号]标识)直接支持其中包含的信息(用于引用目的)。
仅列出直接支持答案的来源索引。若没有匹配的来源,返回[]。若多个来源支持同一事实,优先选择最具体、最直接匹配的来源。
输出必须是单个有效的来源索引JSON数组。
示例输出:[1, 4, 6]
答案:[AI生成的答案]
来源:[网络内容]

A.6 Test2025数据集生成提示词

我们向Gemini 3.0思维模式(通过支持实时谷歌搜索的网页界面)输入以下提示词,生成100个问答对,内容为其知识截止日期后公开的知识:
按照以下风格/长度,生成用于测试基于检索增强生成(RAG)的大语言模型系统的问答对。我需要100个问答对,格式为“.jsonl”,与[MMU-RAGent验证集前10个样本]类似,
聚焦于2025年2月后公开的知识。
----- 示例.jsonl格式 ----

附录B 定性分析与示例

B.1 查询构建输出结果

我们提供更多示例,展示Gemini 2.5 Flash如何将用户输入(源自MMU-RAGent验证集)重写为优化后的搜索查询。该步骤对于处理对话隐含信息(如“我独自生活”)或特定格式要求(如“分步指南”)至关重要。

用户输入 生成的搜索查询
“我独自生活,需要系鞋带,该怎么做?” [‘如何系鞋带’, ‘系鞋带指南’]
“我刚买了一只新小狗,该如何训练它用牵引绳走路?请给我分步说明。” [‘小狗牵引绳训练 分步指南’, ‘如何训练小狗用牵引绳走路’]
“如何在Photoshop中移除照片中不需要的人?” [‘Photoshop 移除照片中的人物’, ‘Photoshop 移除不需要的对象’]
“告诉我如何提取自己购买的Switch游戏并在模拟器中运行。” [‘提取任天堂Switch游戏用于模拟器 指南’, ‘如何提取Switch游戏 用于Yuzu/Ryujinx模拟器’]

B.2 Test2025数据集分析:知识截止日期缺口

Test2025数据集凸显了模型因2025年1月知识截止日期而产生的误差。以下示例展示了HiFi-RAG如何弥补这一缺口,同时包含无需新知识、基准模型仍能正常响应的场景。

案例1:检索增强生成成功(新事件)

在这些示例中,基准模型要么正确表明缺乏相关信息,要么错误拒绝回答,而HiFi-RAG通过检索获取了与真实标签一致的正确答案。

  • 查询:2025年第59届超级碗(Super Bowl LIX)的中场秀表演者是谁?
    • 参考答案:肯德里克·拉马尔(Kendrick Lamar)于2025年2月9日在路易斯安那州新奥尔良的凯撒超级穹顶体育场,领衔出演了苹果音乐第59届超级碗中场秀。
    • 基准模型:“表演者……尚未公布。目前流传的任何名字均为纯粹猜测。”[错误/拒绝回答]
    • HiFi-RAG:“肯德里克·拉马尔是2025年第59届超级碗中场秀的领衔表演者,特邀嘉宾SZA也将同台献艺……”[正确]
  • 查询:2025年9月发布的iPhone 17 Air有哪些新功能?
    • 参考答案:苹果公司于2025年9月推出了iPhone 17“Air”机型……核心功能包括极致纤薄的铝合金机身、单颗4800万像素后置摄像头、A19芯片……
    • 基准模型:“苹果公司尚未发布或宣布iPhone 17 Air……目前可得的任何细节均基于未经证实的传言。”[错误/拒绝回答]
    • HiFi-RAG:“2025年9月发布的iPhone Air拥有史上最薄的iPhone设计……并搭载A19 Pro芯片……”[正确]
案例2:检索增强生成修正(动态更新)

此类场景中,基准模型依赖截止日期前已知的“未来计划”,而HiFi-RAG检索到了更新后的实际情况(如任务延期)。

  • 查询:阿尔忒弥斯二号(Artemis II)任务是否在2025年发射?
    • 参考答案:没有,阿尔忒弥斯二号任务未在2025年发射。该任务原计划于2025年末发射,但美国国家航空航天局(NASA)将其推迟至不早于2026年4月……
    • 基准模型:“阿尔忒弥斯二号任务尚未发射。NASA目前计划的发射日期不早于2025年9月。”[过时信息]
    • HiFi-RAG:“没有,阿尔忒弥斯二号任务未在2025年发射……已推迟至不晚于2026年4月发射。”[正确更新]
案例3:基准模型有效响应(长期规划)

对于提前数年规划的事件(如世界博览会、产品支持终止周期),基准模型通常能正确回答。这表明,若日程安排固定,“未来相关”问题并非都需要检索增强生成技术支持。

  • 查询:2025年世界博览会的举办地在哪里?其主题是什么?
    • 参考答案:2025年世界博览会在日本关西地区大阪举办……官方主题为“设计面向生活的未来社会”。
    • 基准模型:“2025年世界博览会将在日本关西地区大阪举办,其主题为‘设计面向生活的未来社会’。”[正确]
    • HiFi-RAG:“2025年世界博览会将在日本大阪举办……围绕‘设计面向生活的未来社会’这一主题展开……”[正确]
  • 查询:Windows 10系统的官方支持终止日期是什么时候?
    • 参考答案:微软公司于2025年10月14日正式终止对Windows 10家庭版和专业版的支持。
    • 基准模型:“Windows 10系统计划于2025年10月14日正式终止支持。”[正确]
    • HiFi-RAG:“Windows 10系统的官方支持终止日期为2025年10月14日……”[正确]
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐