论文

GDSD:强化学习作为扩散语言模型的引导降噪器 Self-蒸馏

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models

摘要

强化学习 (RL) 可用于改进扩散 大语言模型 (dLLM) 的策略(降噪器),但会受到策略可能性的棘手性的阻碍。一个占主导地位且有效的方法族用根据随机屏蔽序列估计的证据下限 (ELBO) 取代了标准强化学习中的可能性。尽管与 预训练 非常一致,但这些方法通过使用 ELBO 作为似然替代项的训练推理不匹配引入了偏差,这可能会降低性能。在这项工作中,我们提出了 Guided Denoiser Self-蒸馏 (GDSD),直接从优势引导的自教师中提取 dLLM 的去噪器,该去噪器源自反向 KL 正则化 RL 的封闭形式最优值。 GDSD 通过无归一化目标将 dLLM 的降噪器 logits 与教师的降噪器相匹配,从而将 RL 降低为无似然自 蒸馏,从而绕过 TIM 偏差。最近基于 ELBO 的方法作为应用不同 蒸馏 散度的实例而出现,但具有 GDSD 避免的可诊断病症。在使用 LLaDA-8B 和 Dream-7B 进行规划、数学和编码基准测试时,GDSD 始终优于先前最先进的基于 ELBO 的方法,具有更稳定的训练奖励动态,实现了高达 $+19.6\%$ 的测试准确性改进。这些结果表明,直接降噪器 self-蒸馏 在不依赖 ELBO 似然替代项的情况下,可以为 dLLM 提供更稳定、更有效的 RL 程序。代码可在 https://github.com/GaryBall/GDSD 获取。