论文
迷失在插值中:为什么预测反馈在扩散语言模型中失败
Lost in Interpolation: Why Predictive Feedback Fails in Diffusion Language Models
摘要
软掩蔽加速了掩蔽扩散语言模型 (MDLM) 的收敛。现有的公式在原始嵌入空间中通过线性插值 (LERP) 构建这种混合,隐式将该空间视为欧几里德空间。我们分析 MDLM 的嵌入空间,发现掩码和预测标记嵌入在整个训练过程中保持接近恒定的角度 (\approx 73^\circ),而嵌入规范在词汇频率排名上基本保持平坦。这些表明超球面几何,LERP 是错误的插值基元。我们引入了球面软掩蔽 (S-SM),这是一种直接替代方案,可将超球面上的前 (k) 预测与 Fr'echet 均值聚合,并使用球面线性插值 (SLERP) 将该均值与掩膜方向混合,然后恢复原生掩膜范数。我们在广泛的推理时间步长预算中,在已发布的 169M 参数 MDLM 检查点的连续 预训练 上评估 S-SM,SLERP 反馈避免了 LERP 反馈引起的训练退化,并在各种采样预算下提供比普通 MDLM 基线高达 2 倍的 MAUVE 增益,比 TopK/LERP 提高 27.5-56.1%,同时始终保持较低的生成困惑度(比基线高出 16.9-19.6%),同时保持输出熵和收敛性基本不变。