论文

检索器 冗余和多样性如何影响 RAG 有效性

How retriever redundancy and diversity impact RAG effectiveness

模型评测模型行为与机制分析

摘要

在 RAG 中,虽然 检索器 通常根据文档与查询的单独相关性对文档进行排名,但生成器却根据检索到的文档整体生成答案。本文研究了检索到的文档集的冗余和多样性如何影响生成器的答案正确性。之前的工作提供了多种结果:一些表明冗余通过强化相关信息来改善生成,另一些则表明基于 LLM 的相同内容的释义可能是有益的。其中许多研究没有控制混杂因素,例如文档是否包含确切的答案,以及参数知识是否发挥作用。我们进行了一项仔细控制的实验,调查检索到的文档集的三个关键场景:1)重复(同一文档的精确副本),2)释义(LLM 一个文档的改写版本)和 3)多样化(来自不同类型的文档,每个文档都包含不同形式的相关信息)。我们控制哪些文档包含完全匹配或改写形式的答案。评估是通过 FictionalQA 完成的,FictionalQA 是一个合成的虚构问答数据集,可确保 LLM 生成器先验知识无法回答问题;答案必须来自检索到的文档。我们证明重复冗余和 LLM 释义并不能显着提高答案的正确性。然而,提供多样化的文档是非常有益的,可以将答案正确率提高 17%-47%。我们进一步表明,这种改进是由不同形式的文档类型(新闻、博客等)单独驱动的,而不是生成器可以获得更相关的答案的结果。我们的研究结果有助于人们更多地关注新的检索方法如何通过迎合生成器对检索结果多样性的偏好来改进 RAG。