打破 KV 缓存瓶颈:风扇对偶模型通过卓越的关联调用实现 O(1) 解码内存
Breaking the KV Cache Bottleneck: Fan Duality Model Achieves O(1) Decode Memory with Superior Associative Recall
摘要
我们提出了 FDM(扇形对偶模型),这是一种线性序列架构,它解决了序列建模中记忆效率和联想回忆之间的基本紧张关系。 FDM 将序列处理分为两个组件:波组件(通过保相吉文斯旋转进行循环扫描),将长程模式压缩为固定大小的复杂隐藏状态,以及粒子组件(本地全局缓存),通过学习关联寻址检索特定标记,W+K=272 个插槽与序列长度 N 无关。这产生严格的 O(1) 解码内存:在所有提示长度 128-8,192 上固定为 867 MB词元,而 Transformer 为 853-4,247 MB(N=8,192 时减少 4.9 倍)。除了架构之外,我们发现联合训练波和粒子组件会导致收敛不理想。我们提出了 Freeze-Scan,这是一种两阶段训练策略,可冻结循环扫描并与嵌入联合优化缓存,以 44K 步在 WikiText-103 上实现 PPL=64.9,比完整的 微调 (PPL=487) 提高了 7.5 倍。在多查询关联召回(MQAR)上,FDM 达到 0.966 的准确率,超过 Transformer(0.606)59.5%,而没有缓存的纯扫描得分仅为 0.011,证实了粒子组件的必要性。最后,我们引入全息参考光束解码,将复杂的隐藏状态 h_t 解释为编码整个时间历史的全息板。使用当前输入 x_t 作为参考光束来调制 h_t,仅使用 1.3M 附加参数即可将 4 头正交参考光束的 PPL 降低多达 2.13 个点(PPL=62.79),为全息解释提供了经验支持。代码和预训练权重:https://github.com/YasongFan/FDM