论文
阅读踪迹,引导道路:扩散语言模型的轨迹感知强化学习
Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models
摘要
扩散 大语言模型 (dLLM) 通过并行地迭代揭露和修改许多位置来生成响应。这个过程留下了丰富的去噪痕迹,描述了哪些词元变得有信心,哪些词元仍然不稳定,以及何时形成承诺。现有的 dLLM 强化学习方法仅弱使用该信号。平坦执行轨迹的成本较低,但可以为整个轨迹分配单一结果奖励。树的执行轨迹通过分支部分轨迹和向上传播叶子奖励来提供更精细、可验证的训练信号,但计算量很大。我们询问去噪轨迹本身是否可以提供树状监督而无需树级计算。我们引入了 CAPR(缓存分摊路径细化),这是一种 dLLM-RL 算法,它将去噪轨迹总结为紧凑的路径状态,使用缓存的轨迹状态生成廉价的同级延续,并训练块级值头以进行局部块级监督。在逐块揭秘计划下,CAPR 记录路径状态和块进度特征,然后根据每个块中显示的词元在块之间重新分配最终结果奖励。这会训练价值头将一个稀疏奖励转换为块级 PPO 权重。因此,CAPR 恢复了树搜索的大部分粒度,同时避免了完整的树扩展,将执行轨迹生成成本降低到大约是平面执行轨迹的 0.75 倍和树执行轨迹的 0.6 倍(在标准设置下)。跨越 4x4 数独、倒计时、GSM8K 和 Math500,在密集且专家混合的 LLaDA 主干上,CAPR 在 256- 和 512-词元预算 上为 RL 调整的 dLLM 设置了新的技术水平。在数独上,它以不到三分之一的每步计算量匹配最强的树结构基线。