论文

解开 GraphRAG 的结——事实证明 VectorRAG 几乎就足够了

UnWeaving the knots of GraphRAG -- turns out VectorRAG is almost enough

上下文与知识检索增强

摘要

检索增强生成(RAG)系统的关键问题之一是基于块的检索管道将源块表示为原子对象,将此类块中包含的信息混合到单个向量中。然后,这些向量表示从根本上被视为孤立的、独立的和自给自足的,而不试图表示它们之间可能的关系。这种方法没有专门的机制来处理多跳问题。基于图的 RAG 系统旨在通过将信息建模为知识图来改善这个问题,其中节点表示的实体通过稳健的关系连接,并形成分层社区。然而,这种方法也存在其自身的问题,其中一些问题是:为了创建基于图形的索引,组件复杂性增加了几个数量级,以及依赖启发式方法来执行检索。我们提出了 UnWeaver,一种新颖的 RAG 框架,简化了 GraphRAG 的思想。 UnWeaver 使用 LLM 将文档内容分解为可以跨多个块出现的实体。在检索过程中,实体被用作恢复原始文本块的中间方式,从而保持对源材料的保真度。我们认为基于实体的分解可以产生原始信息的更精炼的表示,并且还可以减少索引和生成过程中的噪音。此外,我们通过实验表明,在端到端 QA 评估中,VectorRAG 的性能优于标准 GraphRAG,几乎与当前基于 SOTA 图的解决方案一样好,而成本仅为其一小部分。