论文
GroundedKG-RAG:绑定原文证据的长文档知识图谱检索
GROUNDEDKG-RAG: Grounded Knowledge Graph Index for Long-document Question Answering
摘要
检索增强生成(RAG)系统已在当代 大语言模型(LLM)中广泛采用,因为它们能够提高生成质量,同时减少所需的输入上下文长度。在这项工作中,我们重点关注用于长文档问答的 RAG 系统。当前的方法严重依赖 LLM 描述,导致高资源消耗和延迟、跨层级的重复内容以及由于源文本中没有或有限的基础而产生的幻觉。为了通过关联原文证据提高效率和事实准确性,我们提出了 GroundedKG-RAG,这是一种 RAG 系统,其中知识图谱是从源文档中显式提取并绑定到原文证据的。具体来说,我们将 GroundedKG 中的节点定义为实体和动作,将边定义为时间或语义关系,每个节点和边都以原始句子为基础。我们从语义角色标签(SRL)和抽象意义表示(AMR)解析构建GroundedKG,然后将其嵌入以进行检索。在查询过程中,我们对查询应用相同的转换,并从基础源文本中检索最相关的句子以进行问答。我们根据 NarrativeQA 数据集的示例评估了 GroundedKG-RAG,发现它的性能与最先进的专有长上下文模型相当,成本更小,并且优于竞争基线。此外,我们的 GroundedKG 可供人类解释和阅读,有助于结果审核和错误分析。