论文

CUE-R:超越检索增强生成的最终答案

CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation

模型评测评测方法与指标

摘要

随着语言模型从单次答案生成转向在推理过程中检索和消耗证据的多步骤推理,评估单个检索项目的作用变得更加重要。现有的 RAG 评估通常针对最终答案质量、引用 忠实性 或答案级别归因,但这些都没有直接针对我们在此研究的基于干预的、每个证据项目的效用视图。我们引入了 CUE-R,这是一种基于干预的轻量级框架,用于使用浅层可观察检索使用痕迹来测量单次 RAG 中每个证据项的操作效用。 CUE-R 通过 REMOVE、REPLACE 和 DUPLICATE 运算符扰乱各个证据项,然后测量沿三个效用轴(正确性、以代理指标衡量的证据忠实性 和置信度误差)以及迹线发散信号的变化。我们还概述了用于解释干预结果的操作证据角色分类法。使用 Qwen-3 8B 和 GPT-5.2 在 HotpotQA 和 2WikiMultihopQA 上进行的实验揭示了一致的模式:REMOVE 和 REPLACE 会严重损害正确性和基础性,同时产生较大的跟踪偏移,而 DUPLICATE 通常是答案冗余但不完全行为中立。零检索控制证实这些影响是由有意义检索的退化引起的。双支撑消融进一步表明,多跳证据项可以非相加地交互:删除两个支撑对性能的损害远远大于单个删除。我们的结果表明,仅回答评估会错过重要的证据效应,而基于干预的效用分析是 RAG 评估的实际补充。