论文
FAIR GraphRAG:用于语义数据分析的检索增强生成方法
FAIR GraphRAG: A Retrieval-Augmented Generation Approach for Semantic Data Analysis
摘要
检索增强生成 (RAG) 在提供对特定领域问题的响应时解决了 大语言模型 (LLM) 的限制。基于图的 RAG 方法(例如 GraphRAG)通过捕获知识图 (KG) 内的语义关系来增强检索。虽然 FAIR 原则(可查找性、可访问性、互操作性和可重用性)在科学数据管理中变得越来越普遍,尤其是在医学等复杂领域,但现有的 RAG 方法缺乏对基础知识资源的结构化 FAIRification。这种缺乏限制了它们在这些领域进行公平信息检索的潜力。为了解决这一差距,我们引入了 FAIR GraphRAG,这是一种新颖的框架,它将 FAIR 数字对象(FDO)集成为基于图的检索系统的基本单元。每个图节点代表一个包含核心数据、元数据、持久标识符和语义链接的 FDO。我们利用 LLM 来支持模式构建以及从数据源自动提取内容和元数据。该框架由医生和计算机科学家共同设计,以确保技术和临床相关性。我们将 FAIR GraphRAG 应用于胃肠病学的生物医学数据集,证明其对 RNA 测序数据的适用性。除了确保遵守 FAIR 原则之外,FAIR GraphRAG 还显着提高了问题回答的准确性、覆盖范围和可解释性,特别是对于涉及元数据和本体链接的复杂查询。这项工作展示了将 FAIR 数据实践与基于图的检索技术相结合的可行性。我们看到了将我们的方法应用于教育和商业等其他专业领域的潜力。