论文
语义 DLM+:通过转换内核设计中的偏差-方差权衡改进扩散语言模型
Semantic DLM+: Improving Diffusion Language Models through Bias-variance Trade-off in Transition Kernel Design
摘要
扩散语言模型 (DLM) 作为自回归语言模型的替代方案已表现出强大的扩展能力。然而,它们的性能对过渡内核的选择高度敏感,设计不当的内核可能会导致训练不稳定、收敛缓慢和采样偏差等问题。在本文中,我们通过对泛化误差进行原理性分析来研究这种敏感性,并确定了三个关键因素:渐近偏差(逼近后验分布的困难)、暴露偏差(采样过程中的误差传播)和核离散引起的优化方差。我们进一步比较不同的转换内核:掩蔽扩散产生稀疏且更容易的后验逼近目标,而均匀扩散提供更强的采样侧修复,但导致更难的逼近。受这种权衡的推动,我们重新审视了以前被忽视的变体,语义 DLM (SemDLM),其中转换内核将词元破坏为语义相似的邻域。我们的理论表明,SemDLM 可以通过降低均匀扩散的后验近似难度同时保留修复能力来充当合理的中间地带。然而,我们发现 SemDLM 存在语义盆地问题,即采样重复停留在语义区域内并产生低多样性文本。为了解决这个问题,我们提出了 SemDLM+,它在采样期间添加了全局转换和语义频率惩罚。在 LM1B 和 OpenWebText 上的实验表明,SemDLM+ 提高了训练动态,并实现了具有令人满意的多样性的竞争性语言建模和生成质量。