摘要:尽管大语言模型(LLMs)在事实性问答任务中展现出强大性能,但它们仍易产生幻觉(即生成看似合理但实际错误的内容)和不实回答,尤其是在任务要求超出其参数化知识范围时。事实上,真实性不仅要求准确性——模型还必须识别不确定性,并在不确定时选择拒绝回答,以避免产生幻觉。这对现有方法提出了根本性挑战:以准确性为优化目标的方法往往会加剧幻觉问题,而鼓励拒绝回答的方法则可能变得过于保守,牺牲正确答案。这两种极端情况最终都会损害回答的真实性。在本研究中,我们提出了TruthRL,这是一个通用的强化学习(RL)框架,可直接优化大语言模型的真实性。具体而言,我们采用带全局奖励的近端策略优化(Global Reward Proximal Policy Optimization,GRPO)算法实现TruthRL,并设计了一个简单而有效的三分类奖励机制,以区分正确答案、幻觉回答和拒绝回答。该机制激励模型不仅通过提供正确答案来减少幻觉,还能在不确定时选择拒绝回答,从而提升回答的真实性。在四个知识密集型基准测试中的广泛实验表明,与普通强化学习相比,TruthRL在检索和非检索设置下,均能显著降低28.9%的幻觉率,并提升21.1%的真实性,且在各类基础模型(如通义千问Qwen、Llama)上均表现稳定。深入的消融实验表明,以准确性为驱动的普通方法(如监督微调或采用二元奖励的强化学习)难以平衡事实正确性与不确定性。相比之下,我们提出的以真实性为驱动的TruthRL在准确性和真实性方面均表现出色,凸显了学习目标设计对于开发真实大语言模型的重要性。Huggingface链接:Paper page,论文链接:2509.25760

研究背景和目的

研究背景

随着大型语言模型(LLMs)在自然语言处理任务中的广泛应用,其生成事实性回答的能力显著增强。

然而,这些模型在面对超出其参数知识范围的任务时,仍然容易产生幻觉(hallucination)和不真实的回答。特别是在高风险领域,如法律和医学,不准确的输出可能导致严重后果。因此,如何确保LLMs生成的回答不仅准确,而且能够识别自身的不确定性并在不确定时拒绝回答,成为了一个重要的研究问题。

现有方法在提高模型准确性方面取得了一定进展,但往往忽视了模型识别不确定性的能力。

一些方法通过引入“我不知道”的回答来鼓励模型在不确定时保持沉默,但这可能导致模型过于保守,牺牲了正确回答的机会。另一方面,基于准确性的优化方法可能会无意中鼓励模型产生幻觉,因为模型为了最大化准确性而猜测答案,而不是承认不确定性。因此,如何在准确性和不确定性识别之间找到平衡,成为了一个亟待解决的问题。

研究目的

本研究旨在提出一种基于强化学习的通用框架TruthRL,以直接优化LLMs的真实性(truthfulness)。

TruthRL通过引入一个简单而有效的三元奖励机制,区分正确答案、幻觉和拒绝回答,从而激励模型在提供正确回答的同时,识别并拒绝不确定的问题,减少幻觉的产生。具体目标包括:

  1. 减少幻觉:通过优化奖励机制,显著降低模型在不确定情况下产生幻觉的概率。
  2. 提高真实性:在减少幻觉的同时,提高模型回答的准确性和真实性。
  3. 平衡准确性和不确定性识别:设计奖励机制,使模型能够在提供正确回答和识别不确定性之间找到平衡,避免过于保守或产生幻觉。
  4. 验证框架的通用性:在多个知识密集型基准测试和不同骨干模型上验证TruthRL的有效性和通用性。

研究方法

1. 奖励机制设计

TruthRL采用了一个三元奖励机制,将模型的回答分为三类:正确答案、幻觉和拒绝回答(“我不知道”)。正确答案获得正奖励,幻觉获得负奖励,拒绝回答则获得中性奖励(零奖励)。这种设计鼓励模型在不确定时拒绝回答,而不是猜测答案,从而减少幻觉的产生。

2. 强化学习框架

TruthRL基于广义策略优化(GRPO)算法实现,通过在线强化学习的方式优化模型。在每个训练步骤中,模型生成多个回答,并根据奖励机制计算每个回答的奖励值。然后,使用这些奖励值更新模型的策略,以最大化期望的真实性得分。

3. 知识边界探测

为了更有效地训练模型识别不确定性,研究引入了知识边界探测机制。

通过探测模型的知识边界,识别出模型可能不确定的问题,并将这些问题标记为需要拒绝回答的候选。然后,在训练过程中特别关注这些问题的处理,以提高模型识别不确定性的能力。

4. 实验设置

实验在四个知识密集型基准测试上进行,包括CRAG、NaturalQuestions(NQ)、HotpotQA和MuSiQue。

使用Llama3.1-8B-Instruct和Qwen2.5-7B-Instruct作为骨干模型,比较TruthRL与多种基线方法(如提示学习、监督微调、基于知识增强的微调等)在不同设置下的性能。

研究结果

1. 减少幻觉

实验结果表明,TruthRL显著降低了模型产生幻觉的概率。

在CRAG基准测试上,与 vanilla RL 相比,TruthRL 将幻觉率降低了28.9%,同时将真实性得分提高了21.1%。这一结果在多个基准测试和骨干模型上均得到验证,表明TruthRL在减少幻觉方面的有效性。

2. 提高真实性和准确性

TruthRL不仅减少了幻觉,还提高了模型回答的准确性和真实性。

在CRAG基准测试上,TruthRL实现了最高的真实性和准确性得分,特别是在检索设置下,性能提升更为显著。这表明TruthRL能够激励模型在提供正确回答的同时,识别并拒绝不确定的问题。

3. 平衡准确性和不确定性识别

通过引入三元奖励机制,TruthRL成功地在准确性和不确定性识别之间找到了平衡。

与基于准确性的优化方法相比,TruthRL减少了模型在不确定情况下猜测答案的行为,从而避免了幻觉的产生。同时,与过于保守的方法相比,TruthRL在提供正确回答方面表现更优,表明其能够在保持准确性的同时识别不确定性。

4. 验证框架的通用性

在多个知识密集型基准测试和不同骨干模型上的实验结果表明,TruthRL具有广泛的适用性。

无论是在小型模型还是大型模型上,TruthRL都能显著降低幻觉率并提高真实性和准确性得分。这表明TruthRL是一个通用的强化学习框架,适用于不同规模和类型的语言模型。

研究局限

尽管TruthRL在减少幻觉和提高真实性方面取得了显著成果,但研究仍存在一些局限性。首先,奖励机制的设计可能受到主观因素的影响,不同奖励信号之间的权重分配可能需要进一步调整以优化性能。

其次,知识边界探测机制的准确性可能受到模型初始性能的影响,如果模型初始性能较差,可能导致知识边界划分不准确。此外,TruthRL在处理极端复杂或模糊的问题时仍面临挑战,需要更先进的自然语言处理技术和上下文理解机制来支持。

未来研究方向

针对上述研究局限,未来的研究可以从以下几个方面展开:

  1. 优化奖励机制设计:进一步探索奖励信号之间的权重分配方法,以及如何根据具体任务和模型需求调整奖励机制。可以考虑引入多目标优化技术,以同时优化准确性、真实性和不确定性识别等多个指标。

  2. 改进知识边界探测机制:研究更准确的知识边界探测方法,例如利用集成学习或迁移学习技术来提高模型对知识边界的识别能力。

    同时,可以探索如何将外部知识源(如知识图谱)引入知识边界探测过程中,以提高探测的准确性和覆盖范围。
  3. 结合多模态信息:将文本、图像、音频等多模态信息引入TruthRL框架中,以增强模型对复杂上下文和用户意图的理解能力。

    通过多模态信息的融合和交互,进一步提升模型的推理能力和泛化性能。
  4. 实际应用与部署研究:探索TruthRL在实际应用和部署中的潜力和挑战,包括模型在不同环境中的适应性、鲁棒性和安全性等问题。

    通过实际案例分析和用户反馈收集,不断优化和完善TruthRL框架的设计和实现。
  5. 可解释性和透明度研究:加强对TruthRL框架中模型决策过程的研究和解释,提高模型的可解释性和透明度。

    通过可视化技术、注意力机制分析等方法,揭示模型在减少幻觉和提高真实性方面的内在机制,为模型优化和应用提供有力支持。同时,探索如何将TruthRL框架应用于更广泛的任务和场景中,以推动自然语言处理技术的进一步发展。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐