Meta:大模型推理时检索程序知识

📖标题:Procedural Knowledge at Scale Improves Reasoning
🌐来源:arXiv, 2604.01348v1
🌟摘要
测试时缩放已经成为一种有效的方法来改善具有挑战性的推理任务的语言模型。然而,大多数现有的方法孤立地处理每个问题,并且没有系统地重用来自先前推理轨迹的知识。特别是,它们没有充分利用程序知识:如何重构一个问题,选择一种方法,并在需要时进行验证或回溯。我们介绍了推理记忆,一个用于推理模型的检索增强生成(RAG)框架,该框架显式检索并重用大规模的过程知识。从现有的逐步推理轨迹语料库开始,我们将每个轨迹分解为自包含的子问题-子例程对,产生3200万个紧凑的过程知识条目。在推理时,一个轻量级的思想内提示让模型用语言表达核心子问题,检索其推理轨迹中的相关子例程,并在各种检索到的子例程下进行推理,作为隐式过程先验。在六个数学,科学和编码基准测试中,推理记忆在文档,轨迹和模板知识以及计算匹配的测试时间缩放基线方面始终优于RAG。由于推理预算更高,消融研究表明,这些收益来自两个关键因素:广泛的程序覆盖的源轨迹和我们的分解和检索设计,这两者共同实现了有效的提取和重用的程序知识。
🛎️文章简介
🔸研究问题:现有的测试时扩展方法往往孤立地处理每个问题,未能系统性地复用先前的过程性知识(如如何重构问题、选择策略或回溯),导致推理模型在复杂任务中效率低下且准确率受限,如何解决这一知识复用难题?
🔸主要贡献:论文提出了“推理记忆”框架,通过构建包含 3200 万条目的子问题 - 子程序知识库,并在推理过程中动态检索和注入过程性先验,显著提升了模型在数学、科学和编程任务上的表现。
📝重点思路
🔸离线构建大规模过程性知识库:从现有的逐步推理轨迹语料中,将长轨迹分解为独立的“子问题描述”与“高层解决子程序”配对,形成包含 3200 万个紧凑条目的 datastore。
🔸思维内主动检索增强:在推理开始时,利用轻量级的“思维劫持”提示词引导模型将当前卡点 verbalize 为具体的子问题查询,从而在思维流内部触发对相关知识库的检索。
🔸多样化过程先验下的测试时扩展:检索多个相关的子程序作为隐式先验注入思维链,并在不同的检索指导下采样多条推理轨迹,利用基于长度的不确定性启发式方法筛选最优解。
🔎分析总结
🔸标准文档级 RAG 并不适合推理模型:实验表明,传统的基于文档的事实性检索对指令微调模型有益,但对推理模型增益有限甚至有害,因为推理模型更需要过程指导而非背景事实。
🔸过程性知识检索显著优于其他基线:在六个基准测试中,该方法在无检索基础上最高提升 19.2%,在同等计算量的测试时扩展基线上最高提升 7.9%,且在数学、科学和编码任务上均表现一致。
🔸多样性优先的预算分配策略更有效:随着推理预算增加,将计算资源分散到更多样化的检索子程序上进行探索,比集中算力在单一子程序上能带来更强的性能扩展效果。
🔸细粒度分解与自生成查询至关重要:消融实验证明,将轨迹分解为原子子问题以及让模型自我生成查询语句,是确保检索内容与当前推理状态高度对齐的关键因素。
💡个人观点
论文将“过程性知识”(即解题策略和方法论)结构化并规模化复用,将检索过程无缝嵌入模型的“思维流”中。
🧩附录

更多推荐
所有评论(0)