论文
ContextRAG:用于检索增强生成的无提取分层图构建
ContextRAG: Extraction-Free Hierarchical Graph Construction for Retrieval-Augmented Generation
摘要
图结构检索增强生成 (RAG) 系统可以提高多跳问题的答案质量,但许多当前系统依赖 大语言模型 (LLM) 在索引过程中提取实体、关系和摘要。这些调用增加了随着语料库大小而增长的词元和挂钟成本。我们提出了 ContextRAG,这是一种图 RAG 系统,其图拓扑是在没有基于 LLM 的实体或关系提取的情况下构建的。 ContextRAG 使用残差量化 k 均值和带有 Lukasiewicz 残差逻辑的形式概念分析,在块嵌入上导出模糊概念图。类似桥和满足派生的上下文节点是由软模糊连接和满足操作引起的,而不是由 LLM 编写的图边引起的。在包含 130 个任务的 UltraDomain 子集上,ContextRAG 使用 30 个 LLM 调用和 22,073 个词元构建索引。相比之下,本地 HiRAG 复制压力测试需要 870 个索引调用和 20 个任务子集上的 354 万个词元,然后在图构建过程中失败;线性外推到 130 个任务意味着超过 2300 万个索引标记。 ContextRAG 总体 F1 率为 33.6%,多跳任务 F1 率为 36.8%。激活分析表明,检索前 5 名中至少一个格派生节点的查询比不检索格派生节点的查询获得 +3.9 个百分点 F1;这种关联是诊断性的而非因果性的。