论文
审计医学LLM诊断中的证据使用
Auditing Evidence Use in Medical LLM Diagnosis
摘要
医学LLM常以是否选出正确诊断被评估,但仅诊断准确率不能显示模型是否恰当使用了病例证据。我们对医学诊断中的证据使用做行为审计:把每个病例的患者信息分解为证据单元,在受控证据子集下为候选诊断打分,并在诊断边际中挖掘低阶交互。因为医学证据是相对诊断而言的,审计把交互发现与失败归因分开:大或负的交互可以反映合理的鉴别诊断,可疑交互则需要稳健性检查与临床评审。我们在DDXPlus、CupCase与MedCase上评估五个开源权重LLM。跨数据集,忠实支持与鉴别冲突或抵消构成大部分交互强度——表明许多证据交互在临床上合理而非失败。在一项聚焦DDXPlus、五名盲评员、130项的丰富评审样本中,无效或捷径式案例集中于被否定的或缺失的发现与临床局部证据。这些结果表明准确率可能掩盖候选的证据使用失败,并推动对医学LLM评估的角色感知审计。
