论文
临床人工智能中的起源差距:用于罕见疾病推理的证据可追溯的时间知识图
The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning
摘要
Frontier 大语言模型 生成临床上准确的输出,但其引用常常是捏造的。我们将其称为“起源差距”。我们针对三种罕见的神经肌肉疾病对,在 36 个临床医生验证的场景中测试了 5 个前沿 LLM。没有模型在没有提示的情况下产生临床相关的 PubMed 标识符。当明确要求引用时,最佳模型实现了 15.3% 的相关 PMID;大多数人决定在不相关领域发表真正的出版物。我们提出了 HEG-TKG(分层证据为基础的时态知识图),这是一个基于时态知识图谱的临床主张的系统,该图谱由 4,512 条 PubMed 记录和精选资源组成,具有质量层分层和 1,280 个疾病轨迹里程碑。在使用相同合成模型的受控三组比较中,HEG-TKG 与基线临床特征覆盖率相匹配,同时通过 203 次内联引用实现 100% 证据可验证性。 Guideline-RAG,将重叠的源文档作为原始文本,产生零可验证的引用。 LLM 在没有 PubMed 审核数据的情况下,法官无法区分捏造的引文和经过验证的引文。独立临床医生评估证实了可验证性优势(Cohen's d = 1.81,p < 0.001),且安全性或完整性没有下降。反事实实验表明,对注入的临床错误有 80% 的抵抗力,通过引文追踪可检测到 100%。该系统通过开源模型进行本地部署,因此患者数据永远不会离开机构基础设施。