DASC:混合线性注意力服务的衰减感知状态压缩
DASC: Decay-Aware State Compression for Hybrid Linear-Attention Serving
摘要
混合线性注意力架构最近已扩展到大型开放权重模型,提供具有充分注意力的质量竞争力,同时大幅减少键/值 (KV) 缓存增长。然而,它们的就地循环状态更新使缓存管理变得复杂:前缀重用需要状态检查点和全注意力 KV,而完整存储状态检查点会增加内存压力,导致更多的驱逐和重复预填充。通过分析 Gated DeltaNet (GDN) 和 Kimi Delta Attention (KDA) 的衰减结构,我们发现不同的头和通道在明显不同的时间尺度上保留前缀信息,我们将其称为 \emph{保留视野}。这种变化表明持久状态检查点具有巨大的压缩潜力。基于这一观察,我们引入了\emph{衰减感知状态压缩}(DASC),它从模型权重中导出保留范围,选择长范围状态单元,并将它们打包到不规则的状态检查点布局中。为了与张量并行推理引擎有效集成,DASC 进一步平衡了 TP 等级之间的压缩状态检查点。在重用时,DASC 要么对省略的单元进行零填充,要么从有界后缀刷新它们,并产生额外的计算成本。在 Kimi-Linear 上的检索和端到端推理基准测试中,保守的 DASC 配置仍然接近完全缓存,同时将 KDA 循环状态检查点压缩了 $2.63\times$。在固定状态检查点内存预算下,由此产生的容量增益可将平均首次词元时间 (TTFT) 减少 42.6\%,并将输入吞吐量提高 68.4\%。在较大的压缩比下,后缀刷新可以恢复因更激进的遗漏而损失的大部分准确性,但代价是额外的重放计算。 Qwen 与 GDN 表现出类似的质量效率趋势,表明 DASC 从通道方式的 KDA 扩展到头部方式的 GDN。