论文
学习将 LLM 与本体排序器融合进行罕见疾病诊断
Learning to Fuse LLMs with Ontology Rankers for Rare-Disease Diagnosis
摘要
本体排序对于罕见疾病的诊断仍然有用,因为每个候选者都可以追溯到匹配的患者表型。 大语言模型 (LLM) 可以根据相同的患者描述生成鉴别诊断,但他们的预测缺乏同样清晰的证据线索。我们不是问哪个系统应该取代另一个系统,而是问 LLM 是否可以在不放弃其证据的情况下改进排名器。我们基于行为的融合模型检查两个排名列表、它们的一致性以及每个候选者背后的本体支持,并了解针对个别案例对每个系统的依赖程度。在比较之前,我们删除了由来自相同出版物的基准案例和本体注释引起的记录的测试集泄漏路径。在八个开放的 LLM 中,融合将 Phenopacket Store 上的 Phenomizer Recall@1 提高了 7.86 个百分点,在 RAMEDIS 上提高了 20.18 个百分点。当通过 API 与 DeepSeek-V4-Flash 配对时,仅在另一个 LLM 上训练的融合模型将 Recall@1 从 0.1657 提高到 0.2176,提高了 5.19 点,无需重新训练。对于 90.8% 的正确融合诊断,该疾病保留了可检查的候选级本体证据。这些结果表明,LLM 可以增强现有的诊断工具,而不会丢弃使其有用的结构化证据。