论文
用于人口数据中的知识图富集和假设发现的表型驱动和证据管理框架
A phenotype-driven and evidence-governed framework for knowledge graph enrichment and hypotheses discovery in population data
摘要
当前的知识图(KG)构建方法是验证性的,侧重于恢复已知的关系,而不是识别新的或依赖于上下文的节点。本文提出了一个表型驱动和证据控制的框架,将范式转向结构化假设发现和受控知识图谱扩展。该方法将用于表型发现、因果推理、概率推理的图神经网络 (GNN) 和用于假设生成和主张提取的 大语言模型 (LLM) 集成在统一的管道中。该框架优先考虑在结构上由数据支持且文献中未充分探索的关系。 KG 扩展被表述为一个多目标优化问题,其中候选声明在相关性、结构验证和新颖性方面进行联合评估。帕累托最优选择能够识别非支配主张,平衡确认和发现,避免琐碎或冗余的知识包含。对异质群体数据集的实验表明,所提出的框架产生了更多可解释的表型,揭示了上下文相关的因果结构,并生成了与数据和科学证据相一致的高质量主张。与基于规则和仅 LLM 的基线相比,该方法在合理性、新颖性、验证性和相关性之间实现了最佳权衡。在检索增强设置中,它显着提高了性能 (Recall@5=0.98),同时降低了幻觉率 (0.05),突出了其在为 LLM 输出提供证据依据方面的有效性。