论文

SUP-MIMIC:用于评估 LLM 对矛盾证据的稳健性的多任务临床诊断基准

SUP-MIMIC: A Multi-Task Clinical Diagnosis Benchmark for Evaluating LLMs' Robustness to Contradictory Evidence

模型评测基准与评测资源

摘要

目前对 大语言模型 (LLM) 的评估主要集中在事实知识检索上,忽视了驾驭临床指标和诊断之间复杂的非双射映射的基本挑战。现有的基准无法评估 大语言模型 是否真正具备诊断模糊场景(相同的临床表现可能对应于不同的病因)和诊断融合场景(异质的症状最终表明相同的疾病)所需的推理能力。为了解决这个问题,我们提出了 SUP-MIMIC,这是一种利用 MIMIC-IV-v3.1 的多任务框架,包括基本评估(BA)、诊断分歧任务(DDT)和诊断收敛任务(DCT)。具体来说,DDT旨在评估模型在表型相似病例中的“一对多”消歧能力,而DCT则评估模型跨不同病理生理学途径识别“多对一”诊断模式的能力。对最先进的 LLM 的综合评估表明,与基线任务相比,DDT 和 DCT 的性能大幅下降,暴露了对统计捷径的系统性依赖,而不是真正的因果推理。我们的研究结果进一步凸显了对“健康”预测的保守偏见,这意味着在现实医疗环境中漏诊的风险不小。这项工作建立了量化临床推理稳健性的严格方法,并为增强临床医学中语言模型的安全性提供了路线图。