论文
LinearKV:单一缓存状态足以支撑混合大语言模型的位置无关缓存
LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs
摘要
LLM服务日益依靠位置无关缓存(PIC)加速。然而现有PIC方法都是为全注意力模型构建的,其核心操作建立在token索引的KV缓存之上:匹配可复用的token块、拼接它们的KV条目、并选择性重算少量token以恢复跨块上下文。混合LLM打破了这些原语——它们将大部分注意力层替换为只暴露固定大小状态的线性递归,没有可供拼接或局部修复的token索引KV。这引出一个自然的问题:PIC能否惠及混合模型,需要什么?我们提出LinearKV,一个免训练的混合PIC框架。其关键洞察是解耦初始化:每个线性层将其匹配到的K个局部状态映射为单一初始状态,而全注意力层照旧拼接KV。因此LinearKV与现有PIC方法兼容,原样复用其token选择与重算。在该框架下,我们发现单一缓存状态就足以充当线性层的初始化器。代数上有原则的替代方案——如并发工作HYPIC那样,把全部K个缓存状态组合成精确的全前缀状态——是不必要的,在某些架构上甚至有害。我们在三个混合模型与三个PIC选择器上比较两者。在两个GDN模型上两者打平,都恢复了大部分完整质量(最高达92%);在Mamba-2模型上,精确组合在每个选择器下都崩溃——例如在EPIC下仅恢复46.6%的完整质量,而单一缓存块初始化器达到86.8%。单一状态初始化器还更便宜,把首token时间降至完整预填充的0.46倍,而精确组合还要额外5-17%的开销;结果在8K-32K的LongBench问答与RULER上均成立。