论文

探索更多,推理更好:扩散语言模型的逐步风险敏感 GRPO

Exploring More, Reasoning Better: Stepwise Risk-Sensitive GRPO for Diffusion Language Models

模型训练强化学习

摘要

扩散大语言模型 (dLLM) 通过对序列或连续块进行去噪来生成文本,从而允许并行显示多个标记。具有可验证奖励的强化学习(RLVR)在这些决策中重复使用终端反馈,即使它们的条件环境发生变化。我们提出了逐步风险敏感GRPO(StepRS-GRPO),它改变了去噪状态下群体优势变换的风险系数,同时保留了底层训练器。对于二元奖励,我们证明这种转变正是集中结果优势的即时和状态相关的重新调整。基于能力的校准建议系数尺度,而终点和插值消融指导时间表选择。在多个 dLLM 主干和数学推理基准中,StepRS-GRPO 相对于中心 GRPO 提高了 pass@1 准确性和 pass@k 覆盖率,同时增加了答案多样性。在我们的消融研究中,质量匹配控制支持状态分配和调度方向的贡献,并且在将优势的均方根(RMS)与中心 GRPO 的均方根(RMS)匹配后,增益仍然存在。推理跟踪诊断进一步表明,StepRS-GRPO 的多样性增益超出了最终答案字符串的范围。