论文

重新思考词元预测:树结构扩散语言模型

Rethinking Token Prediction: Tree-Structured Diffusion Language Model

模型架构新型架构

摘要

离散扩散语言模型已成为自回归语言模型的竞争替代品,但在有限的参数和内存预算下有效地训练它们仍然具有挑战性。现代架构主要基于全词汇词元预测层,该层占模型参数的很大一部分(例如,在小规模 DiT 式设计中超过 20%),并且通常主导峰值 GPU 内存使用。这导致在训练资源有限的情况下参数和内存的使用效率低下。为了解决这个问题,我们重新审视显式全词汇预测的必要性,并利用标记之间的固有结构来构建树结构的扩散语言模型。具体来说,我们使用与预构建的词汇树中标记的祖先节点相对应的中间潜在状态来对扩散过程进行建模。这种树结构分解以指数方式降低分类维度,使预测头的大小可以忽略不计,并且能够重新分配参数以加深注意力块。根据经验,在相同的参数预算下,我们的方法将峰值 GPU 内存使用量减少了一半,同时匹配最先进的离散扩散语言模型的困惑性能。