论文

Elastic-dLLM:位置保留上下文压缩和扩散增强 LLM

Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs

模型推理推理加速

摘要

与一次生成一个标记的自回归模型不同,dLLM 联合对一大块 [MASK] 标记进行去噪,并在每一步采样一个或多个标记;尽管启用了并行解码,但由于屏蔽词元的块大小较大,该过程会产生大量的计算成本。我们观察到,大部分成本花费在重复处理前面的上下文和具有相同特征表示的许多 [MASK] 标记上,这表明存在相当大的计算冗余。在这项工作中,我们从 [MASK] 词元的角度重新审视 dLLM 的冗余性。通过系统分析,我们验证了[MASK]词元的冗余性,同时揭示了它们在提供结构信息方面的关键作用。在这些发现的指导下,我们提出了位置保留 [MASK] 词元压缩和终端感知增强。通过压缩冗余 [MASK] 计算,该方法加速了解码,并进一步为全序列 dLLM(例如 LLaDA-8B-Instruct 和 LLaDA-1.5)在有限输入长度约束下提供了对类似上下文折叠的长上下文缩放的自然扩展。此外,对于诸如 LLaDA2.0-mini 之类的块 dLLM,它通过受保护的终端 [MASK] 词元增强了上下文,从而以可忽略的开销提高了生成质量。