论文
关于 RAG Pipelines 中检索内容表示的影响
On the impact of retrieved content representations in RAG Pipelines
摘要
检索增强生成 (RAG) 使用检索到的文档补充语言模型的输入,但大多数 RAG 管道继承了为人类读者设计的检索组件。当消费者是 大语言模型 (LLM) 而不是人类时,检索到的内容应如何表示还不太清楚。最近的工作提出了对检索到的内容进行转换并确定了影响生成的属性,但每个转换或属性都是孤立检查的,而文档表示的哪些特征最重要则没有确定。我们通过受控比较来解决这个问题:保持检索固定,我们仅改变检索到的文档的表示,将原始基线与跨越选择、摘要和重构的十三种转换进行比较,以查询相关和查询无关的变体。在这十四种表示中,我们测量四个生成器的问答准确性,并且对于每种表示,我们还测量答案保留:已知的包含答案的文档在转换后是否仍然支持其答案。我们发现答案保留是生成器准确性的主要决定因素;值得注意的是,当保留率很高时,表示的措辞、结构、长度和查询依赖性的效果有限。这表明,先前工作中特定机制带来的准确率提升可能部分地可以通过这些机制保留答案内容的程度来解释,而如果不控制保留,就无法解决这一归因问题。