论文

NeocorRAG:通过证据链减少不相关信息、更明确证据、更有效回忆

NeocorRAG: Less Irrelevant Information, More Explicit Evidence, and More Effective Recall via Evidence Chains

上下文与知识检索增强

摘要

尽管精确召回是检索增强生成(RAG)的核心目标,但该领域仍然存在一个关键的疏忽:检索性能的改进并不能始终转化为下游推理的相应收益。为了诊断这一差距,我们提出了召回率(RCR),这是一种新颖的评估指标,用于量化检索对推理准确性的贡献。我们对主流 RAG 方法的定量分析表明,随着 Recall@5 的改进,RCR 表现出近线性衰减。我们认为这些方法中对检索质量的忽视是根本原因。相比之下,仅关注质量优化的方法通常会遭遇召回性能较差的问题。这两个类别都缺乏对检索质量优化的全面理解,从而导致了权衡困境。为了应对这些挑战,我们提出了全面的检索质量优化标准并引入了 NeocorRAG 框架。该框架通过系统地挖掘和利用证据链来实现整体检索质量优化。具体来说,NeocorRAG 首先采用创新的激活搜索算法来获得细化的候选空间。然后通过约束解码确保精确的证据链生成。最后,检索到的证据链集指导检索优化过程。根据 HotpotQA、2WikiMultiHopQA、MuSiQue 和 NQ 等基准进行评估,NeocorRAG 在 3B 和 70B 参数模型上均实现了 SOTA 性能,同时消耗的词元不到同类方法的 20%。这项研究提出了一种有效的 RAG 增强 无需训练 范例,可以有效优化检索质量,同时保持高召回率。我们的代码发布于 https://github.com/BUPT-Reasoning-Lab/NeocorRAG。