摘要:扩散型大语言模型(Diffusion Large Language Models,DLLMs)正逐渐成为主流自回归大语言模型的有力替代方案,其具备高效的并行生成能力,且能够进行全局语境建模。然而,DLLMs的实际应用受到一个关键架构限制的阻碍:需要静态预定义生成长度。这种静态长度分配导致了一个问题性的权衡:长度不足会削弱模型在复杂任务上的性能,而长度过长则会带来巨大的计算开销,有时甚至会导致性能下降。虽然推理框架具有刚性,但我们观察到,模型本身具有与给定任务最优响应长度相关的内部信号。为弥合这一差距,我们利用这些潜在信号,引入了DAEDAL——一种新颖的无训练去噪策略,该策略可实现扩散型大语言模型的动态自适应长度扩展。DAEDAL分两个阶段运行:1)在去噪过程之前,DAEDAL从较短的初始长度开始,在序列补全指标的引导下,将其迭代扩展到大致适合任务的长度。2)在去噪过程中,DAEDAL通过掩码标记插入精准定位并扩展生成长度不足的区域,进行动态干预,确保最终输出充分完善。在DLLMs上开展的广泛实验表明,DAEDAL可取得与精心调优的固定长度基线相当、甚至在某些情况下更优的性能,同时通过实现更高的有效标记比率,提高了计算效率。通过解决静态长度限制问题,DAEDAL释放了DLLMs的新潜力,弥合了其与自回归模型之间的关键差距,为更高效、更强大的生成能力铺平了道路。Huggingface链接:Paper page,论文链接:2508.00819

研究背景和目的

研究背景

近年来,扩散型大语言模型(Diffusion Large Language Models, DLLMs)作为大语言模型(LLMs)领域的一个新兴范式,逐渐吸引了学术界和工业界的广泛关注。与传统的自回归大语言模型(Autoregressive Large Language Models, AR LLMs)不同,DLLMs通过多步迭代去噪过程生成文本,利用双向注意力机制(bidirectional attention)将初始掩码序列精炼成连贯的输出。这种机制使DLLMs能够利用全局语境信息进行需要整体规划的任务,并在推理步骤数与生成样本质量之间提供灵活的权衡。

尽管DLLMs具有显著优势,但其实际应用受到一个关键架构限制的阻碍,即需要静态预定义生成长度。这种静态长度分配导致了一个重要的权衡问题:长度不足会削弱模型在复杂任务上的性能,而长度过长则会带来巨大的计算开销,有时甚至会导致性能下降。例如,在数学推理或代码生成等复杂任务中,过短的生成长度可能导致逻辑不完整,而过长的生成长度则可能引入不必要的计算和潜在的逻辑混乱。

相比之下,自回归大语言模型能够根据任务需求灵活调整输出长度,而DLLMs则必须根据给定长度调整任务输出。这种刚性限制不仅在推理开始时造成困境,而且从根本上削弱了模型动态适应的能力。例如,DLLMs缺乏自回归模型在测试时扩展输出的关键能力,无法进行自我纠正。这一问题在DLLMs的非顺序生成特性下尤为突出,模型可能先生成序列的开始和结束部分,却发现为中间推理分配的空间不足,导致逻辑不完整和性能下降。

研究目的

本研究旨在解决DLLMs在静态预定义生成长度方面的关键限制,提出一种无需训练的动态自适应长度扩展策略,使DLLMs能够根据任务需求动态调整生成长度,从而提高模型在复杂任务上的性能和计算效率。具体而言,本研究希望达成以下目标:

  1. 解决静态长度限制:通过引入动态自适应长度扩展策略,消除DLLMs对静态预定义生成长度的依赖。
  2. 提高模型性能:使DLLMs能够在复杂任务上实现更好的性能,避免因长度不足或过长导致的性能下降。
  3. 提升计算效率:通过动态调整生成长度,减少不必要的计算开销,提高计算效率。
  4. 增强模型适应性:使DLLMs能够像自回归模型一样,根据任务需求灵活调整输出长度,提高模型的适应性和泛化能力。

研究方法

为了实现上述研究目的,本研究提出了DAEDAL,一种新颖的无训练去噪策略,该策略通过两个阶段实现DLLMs的动态自适应长度扩展:

1. 初始长度调整(Initial Length Adjustment)

在去噪过程开始之前,DAEDAL从一个较短的初始长度出发,通过迭代扩展生成长度,直到达到一个大致适合任务的长度。这一过程由序列补全指标引导,该指标通过计算模型在序列末尾预测结束标记(EOS)的置信度来评估当前长度是否足够。具体步骤如下:

  • 初始化:从一个较短的初始序列开始,该序列由提示词和多个掩码标记组成。
  • 迭代扩展:在每次迭代中,模型对当前序列进行前向传播,计算EOS标记的置信度。如果置信度低于预设阈值,表明当前长度不足,模型将扩展序列长度,添加更多的掩码标记。
  • 终止条件:当EOS标记的置信度超过阈值或达到最大长度限制时,迭代过程终止,确定一个大致适合任务的初始长度。

2. 迭代掩码插入(Iterative Mask Insertion)

在去噪过程中,DAEDAL通过动态干预,精准定位并扩展生成长度不足的区域。具体而言,模型在每一步去噪中不仅填充高置信度的标记,还标记低置信度的候选位置作为“扩展点”。当序列末尾的EOS标记置信度较低时,模型将这些扩展点替换为多个掩码标记,从而在需要更多详细推理的区域插入额外空间。这一过程确保模型能够在后续去噪步骤中更好地组织语言和逻辑。具体步骤如下:

  • 前向传播与置信度计算:在每一步去噪中,模型对当前序列进行前向传播,计算所有掩码位置的预测置信度。
  • 高置信度填充:识别并填充置信度高于高阈值的掩码位置。
  • 低置信度候选标记:找到置信度低于低阈值的候选位置作为潜在的扩展点。
  • 动态扩展:当序列末尾的EOS标记置信度低于扩展阈值且存在候选扩展点时,选择置信度最低的候选位置,将其替换为多个掩码标记,扩展序列长度。
  • 迭代去噪:重复上述步骤,直到所有掩码位置被填充或达到最大迭代次数。

研究结果

通过在多个数学推理和代码生成基准测试上的广泛实验,本研究验证了DAEDAL策略的有效性和优越性。实验结果表明,DAEDAL能够在不进行任何训练的情况下,使DLLMs实现与精心调优的固定长度基线相当甚至更优的性能,同时显著提高计算效率。具体研究结果如下:

1. 性能比较

  • 数学推理任务:在GSM8K和MATH500等数学推理基准测试上,DAEDAL策略显著提高了模型的准确率。例如,在GSM8K上,DAEDAL策略的准确率达到了85.8%,优于最佳固定长度基线的83.8%。
  • 代码生成任务:在MBPP和HumanEval等代码生成基准测试上,DAEDAL策略同样展现了优越的性能。例如,在HumanEval上,DAEDAL策略的准确率达到了48.2%,优于最佳固定长度基线的46.3%。

2. 计算效率

  • 有效标记比率:DAEDAL策略通过动态调整生成长度,显著提高了有效标记比率(E ratio),即实际用于回答问题的标记数与总生成标记数的比率。例如,在GSM8K上,DAEDAL策略的有效标记比率达到了73.5%,远高于最佳固定长度基线的27.7%。
  • 总标记数:尽管DAEDAL策略在某些情况下生成的总标记数略高于固定长度基线,但由于其有效标记比率更高,实际计算效率显著提升。

3. 动态适应性

  • 长度分布:DAEDAL策略能够根据任务复杂度动态调整生成长度,生成长度分布更加多样化,反映了不同任务的复杂度差异。相比之下,固定长度基线对所有问题采用相同的生成长度,缺乏灵活性。
  • 初始长度鲁棒性:DAEDAL策略对初始长度的选择具有鲁棒性,能够在较宽的初始长度范围内实现稳定性能,无需精心调优初始长度。

研究局限

尽管DAEDAL策略在解决DLLMs静态长度限制方面取得了显著成果,但本研究仍存在以下局限:

1. 阈值选择的敏感性

尽管DAEDAL策略对大多数超参数的选择具有鲁棒性,但EOS标记置信度阈值和扩展因子的选择仍可能对性能产生一定影响。未来研究可以进一步探索自适应阈值选择方法,以提高策略的稳定性和适应性。

2. 复杂任务的处理能力

对于极端复杂的任务,DAEDAL策略可能仍面临生成长度不足或计算开销过大的问题。未来研究可以探索更复杂的动态长度调整机制,以更好地处理这些任务。

3. 实际应用场景的验证

本研究主要在数学推理和代码生成等基准测试上验证了DAEDAL策略的有效性,未来研究可以在更多实际应用场景中验证其性能,如自然语言理解、对话系统等。

未来研究方向

基于本研究的结果和局限,未来研究可以从以下几个方面展开:

1. 自适应阈值选择

探索自适应阈值选择方法,使DAEDAL策略能够根据任务复杂度和模型性能动态调整阈值,进一步提高策略的稳定性和适应性。

2. 更复杂的动态长度调整机制

研究更复杂的动态长度调整机制,如基于任务复杂度的预测模型,以更好地处理极端复杂的任务,避免生成长度不足或计算开销过大的问题。

3. 多任务与跨领域应用

在更多实际应用场景中验证DAEDAL策略的性能,如自然语言理解、对话系统、多模态生成等,探索其在多任务与跨领域应用中的潜力和局限性。

4. 结合其他优化策略

探索将DAEDAL策略与其他优化策略(如并行解码、缓存机制等)相结合的可能性,以进一步提高DLLMs的生成效率和性能。

5. 可解释性与鲁棒性研究

研究DAEDAL策略的可解释性和鲁棒性,深入理解其动态长度调整的机制和影响因素,为策略的进一步优化提供理论支持。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐