论文

RAGU:具有紧凑域自适应 LLM 的多步 GraphRAG 引擎

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

上下文与知识知识图谱

摘要

图检索增强生成(GraphRAG)通过结构化知识增强了 大语言模型,但现有系统在单次提取过程中构建知识图,产生噪声实体和脆弱的检索。 RAGU 是一个开源模块化 GraphRAG 引擎,通过将提取与合并分开来解决这个问题:实体和关系通过两阶段类型化提取、DBSCAN 支持的重复数据删除、LLM 汇总和 Leiden 社区检测。一个关键的见解激发了紧凑的提取器:管道中的 LLM 所需的技能 - 理解、提取、上下文推理 - 是语言技能,与事实世界知识不同,这些语言技能仅随着模型大小而增长较弱。因此,我们训练了 Meno-Lite-0.1,这是一种针对语言技能进行优化的 7B 模型,它在知识图构建方面优于 Qwen2.5-32B(+12.5% 相对调和平均值),并在英语 GraphRAG 任务上与之匹配。在 GraphRAG-Bench(医学)上,RAGU 在每个事实陈述级别检索了最完整的上下文(证据召回率高达 0.84 vs. $\leq$0.76),并在综合任务上超越了 HippoRAG2;在多跳事实 QA 中,HippoRAG2 明显的优势主要是答案格式的产物。 RAGU 可通过 $\texttt{pip install graph_ragu}$ 安装,在单个 GPU 上运行,并在 MIT 下发布。源代码可在 https://github.com/RaguTeam/RAGU 公开获取,Meno-Lite-0.1 模型可从 https://huggingface.co/bond005/meno-lite-0.1 获取。