论文
从自我未来学习:同策略 dLLM 自我 蒸馏
Learning from the Self-future: On-policy Self-distillation for dLLMs
摘要
同策略 self-蒸馏 (OPSD) 已被证明对 后训练 大语言模型 (LLM) 有效,但其在扩散 LLM (dLLM) 中的应用仍有待探索。现有的 OPSD 方法本质上是以自回归为中心的。他们通过从左到右的前缀调节和 词元级 发散监督来注入特权信息,这种设计从根本上与 dLLM 的任意顺序生成相冲突。我们推出 d-OPSD,这是第一个专为 dLLM 量身定制的 OPSD 框架。我们的方法有两个核心贡献。首先,我们通过使用自我生成的答案作为后缀条件来重新构建自教师结构,使学生模型能够从“自我未来经验”而不是特权前缀中学习。其次,我们将监督从 词元级 转移到步骤级别,使训练与 dLLM 的迭代去噪过程保持一致。四个推理基准的实验表明,d-OPSD 始终优于 RLVR 和 SFT 基线,具有卓越的样本效率,仅需要 RLVR 约 10% 的优化步骤,并为 dLLM 后训练开辟了一条有希望的途径。代码可在 https://github.com/xingzhejun/d-OPSD 获取。