论文

ForkLeft:前缀对齐自回归扩散蒸馏的熵优先rollout

ForkLeft: Entropy-First Rollouts for Prefix-Aligned Autoregressive-to-Diffusion Distillation

摘要

自回归下一个标记预测(NTP)在语言模型中实现了强大的推理能力,而扩散语言模型(DLM)提供了灵活的标记顺序和并行生成。我们询问 DLM 是否可以通过蒸馏获得 NTP 式推理,而不放弃其本机生成过程。然而,直接蒸馏面临着根本性的不匹配:自回归教师从左前缀进行预测,而 DLM 可以以两侧的标记为条件。我们引入了 ForkLeft,这是一个蒸馏框架,它通过将学生的展示与教师的监督分开来解决这种不匹配问题。在训练过程中,学生首先执行熵优先的rollout,以提交不确定的位置并暴露潜在的分叉。然后,我们修复生成的学生前缀,并在相同上下文下提取 NTP 教师,答案正确性决定监督源。在推理时,学生返回到其本机置信优先并行解码。借助 Qwen3-30B-A3B-Base,ForkLeft 在所有十个基准测试中改进了 Efficient-DLM-4B,将 MATH500 从 72.60% 提高到 79.60%,并且始终优于三种替代设计。收益随着教师实力的增加而扩大,并推广到 SDAR-4B,只需 500 美元的更新。在匹配的规模上,经过提炼的 4B 和 8B 学生在七个基准上超过了已发布的 SDAR-Chat 和 OPDLM 模型,这表明 DLM 可以在不牺牲本机并行生成的情况下学习 NTP 式推理。代码和数据集将在接受后发布。