论文
扩散语言模型的可学习性 微调
Learnability-Informed Fine-Tuning of Diffusion Language Models
摘要
我们的目标是提高扩散语言模型(DLM)的推理能力。虽然 SFT 是自回归模型的流行 后训练 配方,但它在 DLM 中的使用面临挑战,甚至可能损害性能,尽管其根本原因仍未得到充分研究。我们的分析表明,普通的 SFT 忽视了可学习性,即学习什么内容以及何时学习词元。具体来说,当大部分输入被屏蔽时,稀有标记很难学习,而当大部分输入未被屏蔽时,学习常见标记很简单,因此没有什么价值。在我们的分析的推动下,我们提出了 LIFT,一种用于 DLM 的基于 SFT 的高效 后训练 算法。当大部分输入被屏蔽时,LIFT 学习简单标记;当有更多上下文可用时,LIFT 学习硬标记,从而使训练与不同扩散时间步长的可用信息保持一致。我们的结果表明,LIFT 在六个推理基准上的表现优于现有的 SFT 基准,在 AIME'24 和 AIME'25 上实现了高达 3 倍的相对增益。我们的代码可在 https://github.com/divelab/LIFT 上公开获取。