论文
dTRPO:扩散大语言模型策略优化中的轨迹约减
dTRPO: Trajectory Reduction in Policy Optimization of Diffusion Large Language Models
摘要
扩散大语言模型(Diffusion Large Language Models, dLLMs)为语言生成引入了新范式,同时也为其与人类偏好对齐带来了新挑战。在本工作中,我们旨在通过降低轨迹概率计算的成本来改进dLLM的策略优化,从而支持规模化的离线策略训练。我们证明:(i)在参考策略正则化下,新去掩码token的概率比是中间扩散状态概率比的无偏估计;(ii)完整轨迹的概率可以通过对重新加掩码的最终状态进行单次前向传播来有效估计。通过将这两种轨迹约减策略整合进策略优化目标,我们提出轨迹约减策略优化(Trajectory Reduction Policy Optimization, dTRPO)。我们在7B dLLM上于指令遵循和推理基准中评估dTRPO。结果表明,它显著提升了最先进dLLM的核心性能,在STEM任务上最高提升9.6%,在编码任务上最高提升4.3%,在指令遵循任务上最高提升3.0%。此外,dTRPO凭借离线、单次前向的特性展现出很强的训练效率,并通过高质量输出生成了更高的生成效率。