论文

Alpha 扩散语言模型:单纯因式分解并不是问题

Alpha Diffusion Language Models: Factorization Alone Is Not the Problem

模型训练预训练

摘要

离散扩散语言模型可以并行生成多个标记,但减少去噪步骤的数量可能会导致预测不一致。标准交叉熵训练适合条件词元边缘,而并行生成需要一致的联合预测。我们引入了 Alpha 扩散语言模型 (AlphaDLM),它通过序列级 alpha 损失进行训练,在 alpha 消失的极限内恢复交叉熵,并在 alpha 1 处具有联合模式最佳值。我们的分析描述了目标和因式分解如何共同确定拟合分布。我们确定中间 alpha 保留多个有效完成同时排除无效标记组合的条件。在 TinyGSM 上进行训练,我们的方法仅用四次模型评估就在 GSM8K 上实现了 34.6% 的准确率。我们进一步将该方法扩展到 SDAR-1.7B,并在代码和数学基准上对其进行评估。这些结果表明,改变训练目标可以改善分解扩散语言模型的准确性与计算权衡。