论文

扩散语言模型中的层崩溃

Layer Collapse in Diffusion Language Models

模型评测模型行为与机制分析

摘要

扩散语言模型(DLM)最近已成为自回归(AR)语言模型的竞争替代品,但其激活动态的差异仍然知之甚少。我们在 LLaDA-8B 中描述了这些动态,并确定了一个引人注目的层折叠属性:一些早期层表现出高度相似的折叠激活模式,由在很长的词元范围内持续存在的单个大型超级异常值主导。尽管存在明显的冗余,但这个异常值至关重要:修剪它会导致输出退化为重复的随机词元循环。矛盾的是,LLaDA 中的层总体上包含更多冗余表示,其中冗余在早期层中最为明显——与 AR 模型相反,其中更深的层由于训练不足而变得冗余。我们的分析表明,DLM 中的层崩溃不是由训练不足驱动的,而是由过度训练驱动的:主要异常值成为不可或缺的信息载体,而其余表示则崩溃为冗余结构。这些发现具有很强的实际意义,并通过受控 预训练 实验得到验证。 DLM 对压缩的鲁棒性令人惊讶:3 位 GPTQ 量化下的 LLaDA 在 GSM8K 上仅下降 -1.8%,而 Llama-3.1-8B 下降 -64.7%。最优稀疏性分配在族之间也会发生逆转:平均稀疏度为 50% 时,将更多分配给 LLaDA 中的早期层,与反向策略相比,收益率 +8.4%,而相同的分配成本 Llama -8.4%。我们的研究结果表明,DLM 训练目标从根本上重塑了相对于 AR 模型的层动态,对压缩和部署产生直接影响。代码:github.com/Conzel/super-outlier-dlm。