论文
MaskAhead:面向块扩散语言模型的掩码引导 KV 驱逐
Mask-Guided KV Cache Eviction in Block Diffusion Language Models
摘要
块扩散语言模型在整个生成过程中保留大量键值 (KV) 缓存,并在每个去噪步骤中对其进行处理,从而限制了记忆容量和生成速度。降低这些成本需要决定使用哪个过去的 token 对当前块进行去噪(选择)以及将哪个保留在记忆中用于未来的块(驱逐)。我们提出了 MaskAhead,这是一种 无需训练方法,它使用基于单个掩码查询的排名机制来解决这两个任务。当前区块掩码指导选择,而即将到来的掩码区块的 探针 指导驱逐。两者都根据 KV 条目对注意力输出的估计贡献进行排名。我们的量化变体 Q-MaskAhead 直接从低位 KV 计算选择和注意力,很大程度上保留了所选条目。 Fast-dLLM-v2、DreamReasoner 和 LLaDA2.0-mini 上的实验涵盖了长代推理、长提示问答和大海捞针检索。在长提示 QA 中,MaskAhead 平均将 KV 内存减少 $9.5\times$,相对于密集推理,平均 F1 损失降低 1.2 点。 Q-MaskAhead 将减少量增加到 $20.1\times$,平均 F1 损失为 2.3 点。在批量 32 系统配置文件中,MaskAhead 在密集推理上实现了 $1.23\times$、端到端和 $1.68\times$ 解码阶段加速。
