论文

我们还需要 GraphRAG 吗?对代理搜索系统的 RAG 和 GraphRAG 进行基准测试

Do We Still Need GraphRAG? Benchmarking RAG and GraphRAG for Agentic Search Systems

模型评测基准与评测资源

摘要

检索增强生成 (RAG) 及其基于图的扩展 (GraphRAG) 是通过将生成基于外部知识来改进 大语言模型 (LLM) 推理的有效范例。然而,大多数现有的 RAG 和 GraphRAG 系统在静态或一次性检索下运行,其中一组固定的文档一次性提供给 LLM。相比之下,最近的代理搜索系统能够在推理过程中实现动态、多轮检索和顺序决策,并且通过交互引入隐式结构与普通 RAG 结合时显示出强大的收益。这一进展提出了一个基本问题:代理搜索能否弥补显式图结构的缺失,从而减少对昂贵的 GraphRAG 管道的需求?为了回答这个问题,我们引入了 RAGSearch,这是一个统一的基准,用于评估密集 RAG 和代表性 GraphRAG 方法作为代理搜索下的检索基础设施。 RAGSearch 涵盖了 无需训练 和跨多个问答基准的基于训练的代理推理。为了确保公平和可重复的比较,我们标准化了 LLM 主干、检索预算和推理协议,并报告完整测试集的结果。除了答案准确性之外,我们还报告离线预处理成本、在线推理效率和稳定性。我们的结果表明,代理搜索极大地改进了密集 RAG 并缩小了与 GraphRAG 的性能差距,特别是在基于 RL 的设置中。尽管如此,GraphRAG 对于复杂的多跳推理仍然具有优势,在摊销离线成本时表现出更稳定的代理搜索行为。总之,这些发现阐明了显式图结构和代理搜索的互补作用,并为现代代理 RAG 系统的检索设计提供了实用指导。