论文

DARE:扩散语言模型激活重用以实现高效推理

DARE: Diffusion Language Model Activation Reuse for Efficient Inference

模型推理KV Cache

摘要

扩散 大语言模型 (dLLM) 已成为自回归 (AR) 模型的一种有前途的替代方案,提供了更大的表达能力以及并行生成和更快推理的潜力。然而,开源 dLLM 仍然不成熟,在效率和质量上都落后于 AR 模型。我们发现了 dLLM 的一个未被充分开发的属性:双向自注意力中的“token-wise冗余”。自注意力激活在词元之间高度相关,查询表示的时间变化可以预测相应键、值和输出激活中的冗余。我们引入了 DARE,它具有两种互补机制:DARE-KV(重用缓存的键值 (KV) 激活)和 DARE-O(重用输出激活以减少冗余计算,同时保持质量)。 DARE 实现了每层延迟高达 1.20 倍的降低,并重用了高达 87% 的注意力激活,推理和代码生成基准的下降可以忽略不计。 DARE-KV 和 DARE-O 的平均性能分别仅下降 2.0% 和 1.2%。结合前缀缓存和 Fast-dLLM 等技术,DARE 无需重新训练即可提供附加增益。这些结果将词元明智的重用确立为一种有效策略,可提高基于扩散的 LLM 的效率,同时保持生成保真度。代码:https://github.com/enyac-group/DARE