论文
MoE-nD:用于多轴 KV 缓存压缩的每层专家混合路由
MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression
摘要
KV 缓存是长上下文 LLM 推理的主要瓶颈。现有的压缩方法均作用于四维 KV 张量的单个轴——词元驱逐(序列)、量化(精度)、低秩投影(头部维度)或跨层共享——但对每一层应用相同的方法。我们表明,这种同质性会影响准确性:不同的层对每个压缩操作的响应非常不同,并且驱逐和量化的最佳每层组合也远非统一。我们提出了 MoE-nD,这是一个专家混合框架,可在全局内存预算下将每一层路由到自己的(逐出比、K 位、V 位)元组。离线校准的贪婪求解器选择最小化预测质量损失的路由;在推理时,通过单个注意力补丁联合应用每层异构驱逐和量化。在 LongBench-v1 的 4 任务子集(16k 输入,每个任务 n=50,适应推理模型协议;参见实验部分)上,MoE-nD 的异质变体在 14 倍压缩 (136~MB) 下与我们未压缩的 1.9~GB 基线相匹配,而我们在相当或更小的内存下测试的每个其他压缩基线(1d、2d_uniform、2d)都保持在 8/100 以下。 AIME 推理基准的收益保持不变(比八种配置中最强的每层量化基准高出 6 至 27 分)。两个空结果(MATH-500 和 LongBench 的 TREC)有一个共同的原则原因(短输入,求解器在大多数层上选择 keep=1.0),清楚地描述了每层逐出路由何时有空间提供帮助。