论文
忠实性 不是免费的:审核检索增强生成中的离线 KV 缓存量化
Faithfulness Is Not Free: Auditing Offline KV-Cache Quantization in Retrieval-Augmented Generation
摘要
检索增强生成系统可以预先计算并存储检索到的文档的键值缓存,以避免在每次查询时重新编码上下文。量化这些缓存进一步减少了存储空间,但之前没有任何工作询问压缩是否会损害 忠实性,响应是否仍然基于检索到的证据。 忠实性 和准确性并不等同:模型可以生成不再受给定上下文支持的正确答案。我们在 RGB 和 HotpotQA 上的 INT8 和 INT4 量化下评估 Qwen2.5-7B-Instruct,使用幻觉检测器、NLI 蕴涵和 LLM 判断器测量准确性和 忠实性。 INT8 在这两个指标上几乎是无损的。 INT4 降低了准确性,更重要的是,即使在实际上仍然正确的答案中,超过 90% 的 忠实性 变化都是负面的,即准确性指标对这种回归视而不见。在嘈杂的检索和检索的块越多的情况下,危害就会越大。在部署压缩缓存之前必须审核 忠实性。