论文
准确性等于证据吗? KV缓存压缩下推理忠实性
Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression
摘要
KV 缓存压缩通常通过最终答案的准确性来评估,隐含地假设保留答案也保留了支持它的推理。我们在大型推理模型中测试了这一假设,并表明它可能会失败:在压缩下,正确答案及其可见支持原理的有效性可以以不同的速率保留。我们使用受控固定跟踪重放协议来研究此故障,该协议将推理内容固定并隔离压缩是否保留了已可用跟踪中的可用信息。我们在数学推理、科学 QA、临床计算和长上下文检索的三个模型上评估了十种词元驱逐 KV 压缩方法和一种量化方法。我们测量最终准确性、答案链一致性和扰动 忠实性。在跨任务中,词元驱逐方法可以保持有竞争力的最终答案准确性,同时大幅降低链支持或扰动 忠实性。我们称之为答案-证据差距。保留覆盖范围的量化控制受到的影响要小得多,这表明故障与 KV 内存减少本身的关系较小,而与失去对部分推理跟踪的访问关系有关。代码可在 https://github.com/known-blue-raincoat/Safe_KV_compress 获取。