论文
DACA-GRPO:扩散语言模型中强化学习的降噪感知贡献分配
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
摘要
扩散 大语言模型 是自回归模型的一个令人信服的替代方案,但现有的扩散 RL 方法将所有去噪步骤视为同等重要,并且依赖于有偏差的高方差似然估计。我们发现了两个基本弱点:去噪轨迹上缺乏时间贡献分配,以及用于策略优化的平均场似然估计的系统偏差。为了解决这些问题,我们提出了 GRPO 的降噪感知贡献分配 (DACA-GRPO),这是一种适用于任何 GRPO 式训练器的轻量级、即插即用的增强功能。 DACA-GRPO 引入了两种互补机制:去噪进度分数(从中间预测中提取每个标记的重要性权重,无需额外的前向成本)和分层掩蔽似然(将标记位置划分为分层,以便以大部分序列作为上下文来预测每个标记,从而减少平均场偏差)。在三种 GRPO 基本方法的基础上应用,DACA-GRPO 在涵盖数学推理、代码生成、约束满足和约束生成的七个基准测试中实现了一致的改进,数学推理方面的增益高达 5.6pp,代码生成方面的增益为 7.4pp,约束满足方面的增益为 36.3pp,JSON 模式遵守方面的增益为 5.9pp。