论文

超越准确性:LLM临床评估中的反事实脆弱性和人口统计学偏见

Beyond Accuracy: Counterfactual Fragility and Demographic Bias in Clinical Evaluation of LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

临床LLM评估往往强调答案的准确性;然而,准确性本身并不能测试反事实的一致性或人口统计的鲁棒性。我们使用两项自动扰动测试对 6 名LLM进行了 150 道 MedQA USMLE 问题的评估,以评估他们的表现。反事实有效性(CFV)测试要求每个模型做出最小的、合理的临床改变,以使不同的答案正确。人口统计鲁棒性测试在同一小插图中添加了六个人口统计前缀,并将答案和解释与无人口统计基线进行比较。在 900 次 CFV 尝试中,228 次 (25.3%) 有效,672 次无效。在 5,400 项人口统计比较中,1,097 个答案发生了变化 (20.3%)。自动判断识别出 3,128 个刻板印象证据标志,其中 1,932 个属于广泛的其他类别。 MedGemma 27B 实现了最高的准确度 (87.1%) 和 CFV (63.3%)、最低的答案更改率 (16.0%) 和较低的平均解释人口统计失调 (EDD) 分数 (0.169)。然而,其准确性仍然超过了 CFV,这表明正确的答案并不能保证反事实有效性任务的可靠表现。 OpenBioLLM 的答案更改率和 EDD 最高,而 GLM 的刻板印象标记率最高。这些发现表明,准确性、CFV、答案稳定性、EDD 和刻板印象证据涵盖了不同的评估方面。由于所有判断都是自动化的,并且没有可用的临床医生验证,因此结果支持安全性筛查,但并未确定模型的临床可部署性。