论文

关联不是相似性:学习用于多跳检索的语料库特定关联

Association Is Not Similarity: Learning Corpus-Specific Associations for Multi-Hop Retrieval

上下文与知识检索增强

摘要

密集检索系统通过将相似性嵌入查询来对段落进行排名,但多跳问题需要通过共享推理链关联相关的段落。我们引入关联增强检索(AAR),这是一种轻量级转导重排序方法,该方法训练小型 MLP(4.2M 参数),以使用共现注释的对比学习来学习嵌入空间中段落之间的关联关系。在推理时,AAR 使用双向关联评分对初始密集检索候选集进行重新排序。在 HotpotQA 上,AAR 将段落 Recall@5 从 0.831 提高到 0.916(+8.6 分),无需评估集调整,增益集中在密集基线失败的难题上(+28.5 分)。在 MuSiQue 上,AAR 在传导设置中获得 +10.1 分。在训练分割关联上进行训练并在未见过的验证关联上进行评估的归纳模型没有显示出显着的改进,这表明该方法捕获了语料库特定的共现而不是可转移的模式。消融研究支持这种解释:对语义相似但不相关的段落对进行训练会使检索性能降低到基线以下,而打乱关联对则会导致严重的退化。下游 QA 评估显示检索增益转化为 +6.4 的精确匹配改进。该方法每个查询增加 3.7 毫秒,在单个 GPU 上训练不到两分钟,并且不需要基于 LLM 的索引。