论文
以因果知识图谱支撑医疗LLM:评测框架、指标与心血管试点
Grounding Healthcare LLMs in a Causal Knowledge Graph: Framework, Metrics, and a Cardiovascular Pilot
摘要
大语言模型(LLM)日益被提议用于医疗决策支持,但对其评估仍奖励单答案准确率,而非对干预、机制、危害、证据和不确定性的推理。我们提出一个可复现的、以图为中心的评估框架,用于医疗中面向干预的LLM行为,并在心血管试点中对其做压力测试。该框架有四个组件:(i)一个领域因果知识图谱,其中断言是具有稳定标识符、保留出处的一等节点;(ii)场景条件子图提取步骤,给定任何临床场景即可检索相关的具体化断言子图;(iii)四种受控知识支撑条件,改变检索到的子图组合进模型上下文的方式(无外部知识支撑C1、知识图谱C2、因果图C3、集成C4);(iv)以断言标识符为锚的自动评分管道,在单次运行中计算干预准确率及其他评估指标。为测试该框架,我们构建了一个覆盖八种推理失败模式的类别均衡场景生成器,并把其实例化于心血管图谱。该指标面板沿可解释、非冗余的轴区分各条件:C4获得最强的因果边F1(0.838)、不良反应F1(0.833)、证据准确率(0.738)和无依据断言率(0.114),而C1获得最高的原始干预准确率(0.948),但没有可测量的因果或证据支撑。