论文

Pivot-SD:掩码扩散语言模型的高效自蒸馏

Pivot-SD: Efficient Self-Distillation for Masked Diffusion Language Models

摘要

掩码扩散语言模型(dLM)为复杂推理提供了自回归模型之外有前途的并行替代,但面临独特的信用分配挑战:去噪中少数承诺会急剧降低剩余掩码位置的不确定性并塑造大部分响应。多数dLM后训练配方不用该信号决定训练哪些token——通常训练最终文本或给整个去噪步分配奖励,而非选择塑造响应的个体承诺。我们提出Pivot-SD——高效的离线自蒸馏框架:只监督这些高影响承诺(枢轴)。Pivot-SD用量信息增益度量(对剩余掩码位置不确定性削减)选择枢轴;成功轨迹的枢轴用交叉熵训练,失败轨迹的枢轴用定向unlikelihood训练,失败轨迹其余部分不动。仅用200个问题、每题四次rollout,Pivot-SD使LLaDA-8B-Instruct在数学与代码基准上超越全序列SFT与预算匹配的扩散RL基线。