论文

部分 KV 解码的剩余质量计算

Residual-Mass Accounting for Partial-KV Decoding

模型推理KV Cache

摘要

我们研究了一种受控的部分 KV 解码设置,其中为接收器/尾部锚点和检索到的标记集计算精确的非标准化 softmax 贡献,而剩余的预填充标记由残差估计表示。在选择了依赖于查询的精确支持之后,我们将重点放在会计规则上,并且仅使用详尽的 Top-K 作为预言机选择器,而不是作为可部署的检索系统。所提出的规则保持主干语言模型和精确分支 KV 张量不变。它从学习到的正特征映射 $φ$ 构建固定大小的摘要状态 $(S,u)$,减去检索到的词元特征贡献以保持精确集和残差集不重叠,并将估计的残差分子和分母与一个归一化下的精确分支合并。在 1% 的精确支持预算下,我们的剩余完成方法在所有报告的上下文长度下,在冻结的 1B 和 3B Llama-3.2-Instruct 主干上,比 RULER 和 BABILong 上仅选择的 Top-K 基线有所改进。在 0.5-4% 的精确支持预算扫描中,这种趋势基本上持续存在。在 LongBench 上,摘要结果大多令人满意,而多文档 QA 则好坏参半。注意输出诊断支持检索到的词元减法作为分区一致的会计规则,同时表明主要的剩余误差是未检索到的剩余质量的不完美的学习-$φ$近似。