论文
回到正轨:在扩散中调整奖励和推理状态 大语言模型
Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models
摘要
强化学习 (RL) 对于增强扩散 大语言模型 (dLLM) 的推理能力具有巨大的前景。然而,进展从根本上受到真实生成轨迹和梯度更新过程之间的双重错位的限制:(i)过程奖励错位。稀疏的终端奖励被不加区别地分配给生成过程的所有中间步骤,无法提供有区别的贡献分配。 (ii) 状态轨迹错位。策略更新经常转向人为的、偏离轨迹的状态,在信息量较少的样本上浪费梯度。为了解决这些限制,我们引入了流程对齐策略优化(PAPO),这是一种新颖的框架,通过逐步感知过程奖励(SPR)将 RL 更新与 dLLM 的生成轨迹整体对齐,将稀疏的终端奖励转化为密集的、逐步的信用,以及以高不确定性步骤重放真实轨迹的熵引导历史重演(EHR)。对四个基准测试的大量实验表明,PAPO 的性能显着优于基线,在 GSM8K 上实现了 4.5% 的增益,在 MATH500 上实现了 4.8%,在 Countdown 上实现了 42.2%,在数独上实现了 16.1%。