论文
用于掩蔽扩散语言模型的基于跟踪的 同策略 蒸馏
Trace-Based On-Policy Distillation for Masked Diffusion Language Models
摘要
扩散 大语言模型 (dLLM) 是自回归生成的一种有前途的替代方案。然而,dLLM 的面向推理的 后训练 仍然具有挑战性。用于 dLLM 的监督 微调 (SFT) 需要密集但通常是 离策略 掩码状态,而强化学习 (RL) 依赖于稀疏奖励或价值建模。本文提出了 \textbf{基于跟踪的 同策略 蒸馏 (TOPD)},这是一种教师监督的框架,无需奖励估计即可将推理能力转移到目标 dLLM。关键思想是在 dLLM 自己的去噪轨迹上进行监督,重点关注形成最终响应的跟踪对齐标记决策。具体来说,TOPD 从目标 dLLM 中采样 同策略 扩散轨迹,从相应部分去噪状态的教师模型中获取教师词元分布,并使用 词元级 反向 Kullback-Leibler (Reverse-KL) 目标更新目标 dLLM。这种设计保留了密集的教师监督,同时使训练与模型自身的去噪状态保持一致。在数学推理基准上,TOPD 使 SDAR-4B-Chat 能够与经过 RL 训练的 TraDo-4B-Instruct 的 MATH500 精度相匹配,静态评估下的增益为 +5.7,动态评估下的增益为 +4.5。与经过 RL 训练的对应模型相比,TOPD 通过减少4倍的采样轮次来实现这一目标,相当于模型计算准确率估计提高了96.0倍。