论文
评估 RAG 系统中的多跳推理:基于 LLM 的 检索器 评估策略的比较
Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies
摘要
检索增强生成 (RAG) 通过外部知识增强 大语言模型 (LLM),以更准确地回答问题。然而,评估 RAG 系统(尤其是 检索器 组件)的研究仍然有限,因为大多数现有工作侧重于单上下文检索而不是多跳查询,其中各个上下文在孤立时可能看起来不相关,但在组合时却至关重要。在本研究中,我们使用 HotPotQA、MuSiQue 和 SQuAD 数据集来模拟 RAG 系统,并比较三种 LLM 作为法官的评估策略,包括我们提出的上下文感知 检索器 评估 (CARE)。我们的目标是更好地了解如何在 RAG 系统中最有效地评估多跳推理。 OpenAI、Meta 和 Google 的 LLM 实验表明,CARE 始终优于评估 RAG 系统中多跳推理的现有方法。在具有较大参数数量和较长上下文窗口的模型中,性能提升最为明显,而单跳查询对上下文感知评估的敏感性最小。总体而言,结果强调了上下文感知评估在提高检索增强生成系统的可靠性和准确性方面的关键作用,特别是在复杂的查询场景中。为了确保可重复性,我们在 https://github.com/lorenzbrehme/CARE 上提供了完整的实验数据。