MIT:推理轨迹反转提升大模型拒答能力

📖标题:Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs
🌐来源:arXiv, 2604.02230v1
🛎️文章简介
🔸研究问题:如何有效解决推理型大语言模型在面对无法回答或存在误导的问题时,因幻觉而错误作答而非正确选择拒答的难题?
🔸主要贡献:论文提出了查询错位框架及 TRACEINVERSION 方法,通过反转推理轨迹重构模型意图并对比原始问题,显著提升了模型在多种场景下的拒答准确率。
📝重点思路
🔸提出查询错位框架,将拒答错误重新定义为模型回答了“错误的问题”而非单纯的知识缺失,认为幻觉源于模型对用户查询的误解。
🔸设计 TRACEINVERSION 方法,首先生成模型针对原始问题的逐步推理轨迹,以此作为理解模型内部思维的窗口。
🔸仅依据生成的推理轨迹,利用提示工程让模型反向重构出它实际响应的最可能查询,即模型内心理解的“伪问题”。
🔸计算原始用户查询与重构查询之间的相似度,若两者差异较大,表明模型偏离了原意,从而触发拒答机制。
🔸采用集成策略评估相似度,结合句子嵌入相似度、大模型语义评估以及基于 Granite Guardian 的接地性检测三个模块进行多数投票决策。
🔎分析总结
🔸实验显示 TRACEINVISION 在四个前沿大模型和九个数据集的 36 个测试设置中,有 33 项击败了包括校准、提示和多模型协作在内的最强基线。
🔸该方法平均将拒答准确率提升了 8.7%,特别是在阅读理解以及偏见与安全领域,相比基线方法分别提升了 5.4% 和 11.0%。
🔸在包含不可回答问题的数据集中,该方法性能下降幅度仅为 3% 至 6%,远小于基线方法平均 13% 至 20% 的性能滑坡,表现出极强的鲁棒性。
🔸消融实验证明,不同的相似度度量模块在不同领域各有优势,如句子嵌入擅长数学领域,而接地性检测擅长安全领域,集成投票能综合各所长。
🔸研究发现 Chain-of-Thought 提示反而会降低传统基线方法的拒答能力,而 TRACEINVERSION 专为利用推理轨迹设计,能有效转化这一特性为优势。
💡个人观点
论文不再纠结于模型“知不知道”,而是关注模型“听没听懂”,将黑盒的幻觉问题转化为可量化的“查询对齐”问题。
🧩附录

更多推荐
所有评论(0)