论文

答案存在驱动RAG重写的增益

Answer Presence Drives RAG Rewriting Gains

模型评测模型行为与机制分析

摘要

检索增强的 QA 管道通常会在较小的读者之前通过 LLM \emph{rewriter} 路由检索到的段落,从而在多跳基准上将 F1 提升数十个点;这一成果通常归功于证据质量的提高。我们询问这种提升是否是由重写上下文中出现的参考答案字符串因果驱动的,而不是通过使用受控干预审计的策展本身来驱动的。对于每个重写的上下文,我们在对编译输出进行四种受控编辑之一后重新运行阅读器:删除参考答案范围,替换长度匹配的随机非答案范围(安慰剂),或将黄金注入到不存在的重写中(在前缀或中点句子边界)。在涵盖三个读者系列(Qwen2.5-7B、Qwen3.5-35B、GLM-4.7)、两个数据集(HotpotQA、2WikiMultihopQA)和三个编译器安排(仅 MA、仅 MB、MA$+$verify)的 12 次完整(单元、基线)干预运行中,删除参考答案会使读者 F1 比配对的长度匹配安慰剂多出 28到 64点\texttt{answer-in-compile} 层,并将黄金预先添加到缺少它的重写中,在 $12$(单元格,基线)组合的 $10$ 中将 F1 提高 $+0.7$ 至 $+9.7$ 点。配套的五哨点审计显示,传统的单\texttt{[MASK]}探针本身哨兵脆弱:在2Wiki上,它报告$+4.12$~F1“非泄漏残差”,在四个替代哨点下翻转到$-3.33$到$-7.81$~F1,并且未能通过这四个哨兵中的三个的等价性测试($1/4$~通过)。我们不建议新的重写器或缓解措施;我们发布了干预运行器和哨兵面板,以便可以根据相同的标准测试其他重写器增益声明。