论文

将 RAG 阅读中的语义竞争与上下文长度分开

Separating Semantic Competition from Context Length in RAG Reading

模型评测模型行为与机制分析

摘要

即使检索到正确的段落,检索增强生成 (RAG) 系统也可能做出错误响应。该模型仍然必须读取检索到的段落,并识别哪一个段落包含看起来相关的答案。这种阅读文章的模型称为阅读器。它失败仅仅是因为上下文较长还是因为其他段落确实与正确的段落竞争?我们介绍并演示了用于 RAG 阅读的匹配控制协议:我们保持段落的数量和长度固定,但用竞争力较弱的真实段落替换硬竞争对手。我们将此控制应用于 SQuAD 上的两个紧凑开放模型。此替换部分恢复了性能,对 F1 和答案包含的影响最大。对于 Phi-2,这将恢复 +6.0 EM 分、+7.0 答案包含分和 +0.057 F1。对于 Qwen2.5-1.5B,它恢复 +4.5 EM 分、+9.0 答案包含分和 +0.068 F1。为了跟踪随着竞争对手积累而表现如何变化,我们还报告保留曲线,并在曲线不交叉半保留时用右删失半衰期对其进行总结。总之,这些结果表明该协议隔离了与上下文长度不同的竞争效应,尽管 F1 和答案包含的效应比精确匹配的效应更清晰,并且也随片段长度的变化而变化。