论文
EnSI-RAG:用于长文档问答的实体结构索引检索增强生成
EnSI-RAG: Entity-Structure-Indexed Retrieval-Augmented Generation for Long-Document Question Answering
摘要
对长且相互关联的文档进行问答 (QA) 仍然具有挑战性,因为相关证据可能跨越多个实体及其关系。现有的检索增强生成(RAG)方法通常将文档索引为原始块,并通过嵌入相似性来检索它们。当块边界将实体与支持证据分开或问题需要跨语料库进行多跳推理时,它们的性能就会下降。我们提出了 EnSI-RAG(实体结构索引检索增强生成),这是一个构建独立于查询、以实体为中心的索引的框架。每个记录 (e, t, k, v) 表示一个实体 e、其类型 t、{属性、关系、方面} 中的语义类别 k 和值 v,同时保留到原始源段落的链接。在查询时,这些记录充当检索句柄,并且 LLM 将检索到的段落合成为最终答案。这种设计将证据本地化与答案合成分开,同时保留可追溯的来源证据。在 Loong 和 Oolong 中,EnSI-RAG 的平均准确度为 78.24。相对于用作参考的已发布基线分数,该分数高出 6.62 分,表明其在这些设置中的有效性。代码可在 https://github.com/RamonMeng/EnSI-RAG 获取。