论文

MolBioKG:通过多分辨率结构锚定将图外分子落地到生物医学知识图谱

MolBioKG: Grounding Out-of-Graph Molecules in Biomedical Knowledge Graphs via Multi-Resolution Structural Anchoring

上下文与知识知识图谱

摘要

生物医学知识图谱(KG)加速药物发现,但标准管线假设查询分子已作为图实体存在,使未注册分子处于断连状态。我们应对这一被称为图外分子问题的冷启动挑战,提出MolBioKG。这个双层系统通过多分辨率结构锚定将未见分子与生物医学证据连接起来。它将一个以骨架、片段、官能团与指纹表示的274万分子索引,连接到一个960万边的知识图谱。仅需给定一个SMILES字符串,MolBioKG即可检索结构相关的图实体并遍历其生物医学邻域,无需任务特定训练。它包含两种推理机制:使用倒数排名融合(Reciprocal Rank Fusion)的静态多锚检索,以及Adapt-KG——一种用于自适应遍历的工具使用LLM策略。在图内链接恢复、复杂多跳推理与图外泛化上的评估中,MolBioKG超越了强基线。值得注意的是,它将多跳推理的Hits@10从0.585提升到0.876,将图外目标召回从0.145提升到0.269,同时确保预测保留可追溯的结构锚定与带来源归因的KG证据。

MolBioKG:通过多分辨率结构锚定将图外分子落地到生物医学知识图谱:论文配图
图1:MolBioKG推理流程。(1) 给定一个图外查询分子。(2) 四个结构锚点检索药物类似物,并通过两种互补机制组合:对所有视图进行静态RRF融合,以及Adapt-KG——一种LLM驱动的跨层桥接方法,用于选择带类型的KG工具。(3) 从这些锚点出发遍历KG,Adapt-KG迭代多轮,直至LLM认为证据充分。(4) 聚合各锚点的证据,多锚点共识可强化预测,确保每个最终候选都有完全可追溯的结构与图路径支撑。