论文

相同的代理,不同的答案:检索增强 QA 中对语料库引起的答案流失的重复感知审核

Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA

模型评测评测方法与指标

摘要

即使其请求的模型标识符、提示、检索策略、证据深度、渲染和公开的生成控制保持固定,检索增强的 QA 系统也可以在索引扩展后返回不同的答案。当收益和损失抵消时,总体精度可能会隐藏这些变化,而普通的生成波动会使一次性比较夸大更新效果。我们将这种隐藏现象称为准确性盲目答案流失,并引入\emph{快照兼容性审核},它通过从跨快照分歧中减去相同快照重复分歧来估计过度答案流失。我们通过将一个冻结的 FineWeb 前缀从 1 个分片扩展到 7 个分片来实例化它。在一项预先注册的 400 个问题自然问题研究中,标准化精确和盲化语义过度流失分别为 6.44 和 10.25 个百分点,而精确匹配准确度仅变化 -1.50 个百分点。事后分析发现 40/400 个问题具有重复稳定的语义翻转。一项单独预先注册的 200 个问题 TriviaQA 研究产生了较小的、方向一致的过度流失,而精确匹配的准确性则朝相反的方向发展。使用第二个 DeepSeek 生成器和服务配置进行结果盲目的事后 100 个问题子集复制发现,即使精确匹配提高了 3.00 个百分点,语义过量流失率仍为 8.75 pp。因此,如果没有明显或一致的效用转变,答案级兼容性可能会失败。检索增强版本应与实用程序一起审核兼容性。