论文

面向扩散语言模型的高效稳定强化学习

Efficient and Stable Reinforcement Learning for Diffusion Language Models

模型训练强化学习

摘要

强化学习(RL)对于释放扩散式大语言模型(dLLM)的复杂推理能力至关重要。然而,将RL应用于dLLM在效率与稳定性上面临独特挑战。为应对这些挑战,我们提出时空剪枝(Spatio-Temporal Pruning,STP),一个旨在同时提升dLLM强化学习效率与稳定性的框架。STP通过以下方式压缩生成过程中的冗余:(1) 空间剪枝,利用静态先验约束探索空间;(2) 时间剪枝,跳过多余的后期精炼步骤。我们的理论分析证明,STP严格降低对数似然估计的方差,从而确保更稳定的策略更新。大量实验表明,STP在效率与准确率上均超越最先进基线。代码发布于 https://github.com/Lolo1222/STP。