论文
扩散语言模型的相对评分策略优化
Relative Score Policy Optimization for Diffusion Language Models
摘要
扩散 大语言模型 (dLLM) 为并行和高效的文本生成提供了一条有前途的途径,但提高其推理能力需要有效的 后训练。具有可验证奖励的强化学习 (RLVR) 是实现此目的的自然选择,但其在 dLLM 中的应用因缺乏易于处理的序列级对数比而受到阻碍,而这对于标准策略优化至关重要。缺乏易于处理的序列级对数比迫使现有方法依赖于基于高方差 ELBO 的近似,其中高验证者奖励可能会放大不准确的分数估计并破坏 RL 训练的稳定性。为了克服这个问题,我们提出 \textbf{R}elative \textbf{S}core \textbf{P}olicy \textbf{O}ptimization (RSPO),这是一种简单的 RLVR 方法,它使用可验证的奖励来校准 dLLM 中的噪声似然估计。我们算法的核心依赖于一个关键的观察:奖励优势不仅可以解释为更新方向,还可以解释为当前策略和参考策略之间相对对数比的目标。因此,RSPO 通过将其奖励优势与奖励隐含的目标相对对数比率进行比较来校准这种嘈杂的相对对数比率估计,根据当前估计与目标之间的差距而不是仅根据原始优势来更新策略。数学推理和规划基准的实验表明,RSPO 在规划任务和竞争性数学推理性能方面取得了特别显着的收益。