EXYGEN:支持大规模知识图谱理解的图探索引擎
Enabling Knowledge Graph Understanding at Scale with the EXplore Your Graphs ENgine (EXYGEN)
摘要
我们推出了 EXYGEN(EXplore Your Graphs ENgine),这是一个知识图 (KG) 理解框架,可实现大规模对话访问 KG。我们依次解决两个问题。首先,仅在自动派生的结构化元数据和小型图形样本(而不是特定于任务的微调)的情况下,LLM 执行文本到 SPARQL 生成的效率如何?我们将 VoID 描述和 ShEx 模式集成到检索增强生成 (RAG) 管道中,并在 SciQA 基准上消除 KG 派生的上下文。我们的最佳配置——结合 ShEx 模式、检索的三元组和示例问题查询对——在执行结果上达到 0.419 的精确匹配,无需任何 LLM 微调。我们进一步发现,诸如 F1 之类的词汇指标很难预测查询的正确性,并且一旦给出足够的上下文,较大的通用 LLM 可以胜过较小的代码专用 LLM。其次,我们询问如何从非常大的知识图谱中生成该方法所依赖的结构化元数据,其中知识图谱元数据的生成在计算上变得非常困难。我们引入了一种谓词覆盖感知并行图采样策略,该策略保留结构多样性,同时保持计算上的易处理性。在 OpenCitations Meta 和 GESIS 上,它保留了较高的谓词覆盖率和最小的三元组损失,并将运行时间缩短了 80 倍以上;在 ORKG 上,采样不仅速度更快,而且是获取完整元数据的唯一易于处理的路径。总之,这些结果表明,结构化模式上下文和轻量级提示可以大大减少对知识图谱可扩展会话访问微调的依赖,尽管缩小与完全微调方法的剩余差距可能需要减少对策划的问题查询示例的依赖——无论是通过合成生成还是执行反馈驱动的方法——并在单一基准之外验证这些发现。