论文
HypoKG:超越端点知识的循证生物医学假设生成
HypoKG: Evidence-Disciplined Biomedical Hypothesis Generation Beyond Endpoint Knowledge
摘要
大型语言模型(LLM)可以生成生物医学假设,但目前尚不清楚它们是否真正根据科学证据进行推理,或者只是产生听起来令人信服的想法。为了研究这一点,我们将三个主要的生物数据库:京都基因和基因组百科全书 (KEGG)、Rhea 和 UniProt 结合成一个统一的生化知识图,并构建了连接酶源和罕见疾病终点的 550 条路径的基准,在改变每个模型接收的生物信息的四种条件下从 6 个大语言模型中产生了 13,200 个假设:仅源酶、完整生物路径或仅源和疾病终点。使用专家得出的五标准评分标准对假设进行评分,每个标准按 1-5 级评分。我们发现,给定来源和疾病终点的模型通常会产生得分最高的假设,这表明大语言模型可以从最少的信息中产生令人信服的想法。然而,这些假设缺乏证据依据。相反,给出完整生物路径的模型生成的假设与已知的机械关系更一致。我们称之为循证推理。为了确认这种效果,我们在保持端点固定的同时打乱了中间路径步骤。证据基础显着下降(delta = -0.793,p < 0.001),证实模型在推理过程中真正使用了路径结构。我们的研究结果表明,知识图以两种方式支持假设的生成:它们识别文献中缺少的生物端点对,它们的机制路径指导大语言模型如何在它们之间进行推理。