论文
为生物医学推理编织多源证据:BioMedHop 基准和 BioWeave 框架
Weaving Multi-Source Evidence for Biomedical Reasoning: The BioMedHop Benchmark and BioWeave Framework
摘要
生物医学问答 (QA) 越来越需要对交互实体进行推理,其中支持证据分散在生物医学知识图、文献文档和可通过网络访问的资源中。然而,现有的生物医学 QA 基准主要侧重于考试式知识、文献理解或短程多跳推理,而对源条件图推理和证据拓扑构造的探索还不够。为了填补这一空白,我们引入了 BioMedHop,这是一个基于多源图的基准,用于评估结构化证据拓扑的生物医学推理。 BioMedHop 包含跨 KG、文档、Web 和混合证据设置的 10,045 个实例,涵盖共享邻居匹配、交叉推理、基于路径的推理和计数,以及基于选项、开放式和数字计数渲染。为了支持这个基准,我们进一步提出了BioWeave,一个源感知推理框架,它检索生物医学知识图谱路径,从文档和网络源中收集支持线索,将它们组装成统一的证据图,并通过实体级证据支持验证答案。综合实验表明,BioWeave 在 BioMedHop 上的对比方法中取得了最佳的整体性能,总体平均性能比强混合基线 ToG-2 高出 10.5%。此外,BioWeave 不断改进不同的 LLM 主干,并使 Qwen3-4B 等较小的模型能够实现与 GPT-4-Turbo 相当的推理性能。