论文
dOPSD:同策略 用于扩散语言模型的自 蒸馏
dOPSD: On-Policy Self-Distillation for Diffusion Language Models
摘要
扩散 大语言模型 (dLLM) 通过迭代地对屏蔽序列进行去噪来生成文本,为自回归模型提供了并行替代方案,但通过 后训练 引发强推理仍然很困难:监督 微调 是 离策略 并遭受暴露偏差,而强化学习仅提供稀疏的序列级奖励,并且在没有易于处理的序列的情况下很难应用可能性。 同策略 self-蒸馏 (OPSD) 提供了一种有前途的替代方案,使用一个模型作为学生和教师来提供密集的 词元级、同策略 监督,但其有效性取决于为教师提供特权信息 (PI) - 通常是推理时无法获得的特定于实例的 真值 参考 - 因此学生最终会提炼出弱的无 PI 共识政策对 dLLM 推理几乎没有什么改进。我们引入了 dOPSD,它直接从学生自己的去噪轨迹中获得教师的优势,使用同一轨迹的后续、更多解码步骤而不是外部标签来评估屏蔽位置,因此教师的优势来自于模型自己的解码过程;在 Dream 和 LLaDA 上,dOPSD 改进了域内数学推理和域外代码生成,优于监督基线和 同策略 基线。