论文
自蒸馏轨迹感知玻尔兹曼模型:弥合扩散语言模型中的训练与推理差异
Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models
摘要
扩散语言模型 (DLM) 最近成为自回归语言模型的一种有前景的替代方案,提供更强的全局意识和高度并行的生成。然而,具有基于标准负证据下界 (NELBO) 的监督 微调 的 后训练 DLM 仍然效率低下:训练在一步中重建随机屏蔽标记,而推理则遵循置信引导、多步从易到难的去噪轨迹。最近基于轨迹的自 蒸馏 方法主要利用此类推理轨迹进行采样步压缩和加速,通常会提高解码效率,而不会显着增强模型的底层能力,甚至可能会降低全扩散解码下的性能。在这项工作中,我们询问自蒸馏轨迹是否不仅可以用于更快的推理,还可以用于真正的知识获取。尽管这些轨迹位于预训练的 DLM 自己的分布流形上,因此提供了潜在的较低优化障碍,但我们发现,使用标准 NELBO 目标对它们进行简单的 微调 只能产生边际收益。为了解决这个限制,我们通过 \textbf{Bo}ltzmann \textbf{M}odeling (\textbf{TABOM}) 提出 \textbf{T}rajectory-\textbf{A}aligned 优化,这是一个基于自蒸馏轨迹的 后训练 框架,将训练与由易到难的推理结构对齐。 TABOM 将推理揭露偏好建模为预测熵上的玻尔兹曼分布,并导出易于处理的成对排序目标,以使模型的确定性排序与观察到的解码轨迹保持一致。从经验来看,与标准 SFT 相比,TABOM 在新领域取得了实质性进展,扩展了 DLM 的有效知识边界,并显着减轻了灾难性遗忘。