论文
TRIMS:扩散语言模型的轨迹排序指令屏蔽监督
TRIMS: Trajectory-Ranked Instruction Masked Supervision for Diffusion Language Models
摘要
扩散语言模型 (DLM) 为通过并行解码实现低延迟生成提供了一条有希望的途径,但其实际效率在很大程度上取决于解码轨迹。在实践中,这种优势通常无法完全实现,因为标准训练没有对词元显示顺序提供明确的监督,从而产生训练推理不匹配,从而导致解码行为不理想。我们提出了轨迹排序指令屏蔽监督(TRIMS),这是一个简单的轨迹引导监督 微调 框架,它以最小的开销将轨迹监督注入到标准屏蔽扩散语言模型(MDLM)训练中。 TRIMS 没有依赖昂贵的基于 DLM 的 蒸馏,而是使用来自自回归教师的轻量级信号来指导轨迹感知掩蔽策略,鼓励模型学习更有效的解码顺序。在 LLaDA 和 Dream 上跨数学和编码基准的实验表明,TRIMS 显着改善了标准 MDLM 训练和无训练加速基线的准确性与并行性权衡,同时以大幅降低的训练成本实现了与之前基于 蒸馏 的方法的竞争性能。进一步的分析表明,TRIMS 可以更好地解码轨迹,验证了 DLM 轨迹引导监督的有效性。