论文

EHRAG:通过混合超图构建与检索弥合轻量级GraphRAG中的语义鸿沟

EHRAG: Bridging Semantic Gaps in Lightweight GraphRAG via Hybrid Hypergraph Construction and Retrieval

上下文与知识知识图谱

摘要

基于图的检索增强生成(GraphRAG)通过将语料库结构化为图来促进多跳推理,从而增强大语言模型(LLM)的能力。尽管近期的轻量级方法通过利用命名实体识别(NER)降低了索引成本,但它们严格依赖结构共现,无法捕捉互不相连实体之间的潜在语义联系。为解决这一问题,我们提出EHRAG,一个轻量级RAG框架,它构建同时捕捉结构层面与语义层面关系的超图,并采用结构-语义混合检索机制。具体而言,EHRAG基于句子级共现并结合轻量级实体抽取来构建结构超边,通过聚类实体文本嵌入来构建语义超边,确保超图同时涵盖结构与语义信息。在检索方面,EHRAG执行结构-语义混合扩散,结合主题感知打分与个性化PageRank(PPR)精炼来识别top-k相关文档。在四个数据集上的实验表明,EHRAG优于最先进的基线方法,同时保持线性索引复杂度且构建过程零token消耗。代码发布于 https://github.com/yfsong00/EHRAG。

EHRAG:通过混合超图构建与检索弥合轻量级GraphRAG中的语义鸿沟:论文配图
图1:语义鸿沟示例:结构图无法关联monarch与Queen等离散实体,EHRAG经语义超边将其桥接,实现多跳推理检索。