论文

HOPD:利用尚未确定的Token提案改善扩散模型蒸馏

Hesitation-Aware On-Policy Distillation for Diffusion Language Models

摘要

扩散大语言模型 (dLLM) 通过迭代去屏蔽生成文本。在每个去噪步骤中,dLLM 在每个屏蔽位置提出一个标记,但解码器仅提交这些建议的一个置信子集。基于跟踪的策略蒸馏(TOPD)建立在这个过程的基础上,通过将学生与更强大的老师相匹配,但仅限于承诺的位置。我们认为,这丢弃了许多有用的信号,这些信号存在于未提交的提案中,学生已经做出了预测,但还没有足够的信心来提交它。我们称这些建议为犹豫。在我们对 SDAR-4B 学生进行的试点研究中,犹豫仅占可监督状态-位置对的 24%,但却占师生分歧的 66%。为了利用这个信号,我们提出了犹豫感知的策略蒸馏(HOPD),它将教师分布匹配扩展到每个去噪步骤的每个屏蔽位置。由于犹豫所提供的信息并不相同,因此我们使用完整轨迹的后见之明进一步分配监督,将更多的权重放在提案后来与最终词元不一致的位置以及第一步提案很少存活的区块上。由于这两个模型已经在所有掩蔽位置产生分布,因此 HOPD 不需要在 TOPD 上进行额外的前向传递。唯一的额外成本是评估更多头寸的损失。通过从 TraDo-8B-Instruct 中提取的 SDAR-1.7B 和 SDAR-4B 学生,HOPD 在静态和动态解码以及两种尺度下的五个数学和编码基准的评估方法中获得了最佳平均分数。它还可以加快解码速度。在 SDAR-4B 上,HOPD 学生的犹豫更少,并且比 TOPD 的每个去噪步骤多投入 11% 的标记,同时达到更高的准确度。