论文
验证不充分:多跳 RAG 上的每块过滤失败,分解修复它
Verification Without Sufficiency: Per-Chunk Filtering Fails on Multi-Hop RAG, and Decomposition Repairs It
摘要
检索增强生成的验证通常会对每个检索到的块进行评分并丢弃失败的块。我们证明这不适用于多跳问题,并展示了它的作用。每块评分假设一个块是答案的充分前提。多跳问题的构建是为了不存在任何问题,并且包含答案的段落是问题未命名的段落。在 HotpotQA、2WikiMultihopQA 和 MuSiQue 上,蕴涵评分达到 0.643、0.523 和 0.560 AUC,而在单跳 SQuAD 上为 0.951。七个控件排除模型容量、前提长度、假设模板、决策阈值、检索器、答案匹配标准和提示。在三个数据集、三个生成器大小和两个提示中,每个块的门控比在每个单元中根本不进行过滤要差得多,并且其惩罚随着生成器的能力而增长。修复是对分解后的子问题而不是原始查询进行条件验证。使用 MuSiQue 的标准分解,后一跳的蕴涵从 0.546(这是偶然的)上升到 0.840,配对提升为 +0.355,引导区间为 [0.331, 0.382]。考虑到问题和检索到的顶部段落,现成的 Qwen2.5-7B 分解器达到 0.637 并捕获该上限的 31%;不进行检索的分解达到 0.533,低于原始问题。迭代检索系统已经产生此类分解并在验证之前将其丢弃。