论文
正确答案,错误原因:准确性、一致性和共识是临床决策支持中LLM忠诚度的误导性指标
Right Answer, Wrong Reason: Accuracy, Consistency, and Consensus Are Misleading Indicators of LLM Faithfulness in Clinical Decision Support
摘要
临床大语言模型 (LLM) 实现了极高的医学检查准确性;然而,正确的答案并不能保证解释指出了实际推动决策的概念。我们为这种忠实度差距引入了三个轻量级、可直接解释的指标:解释稳定性指数(ESI),它衡量重复查询之间的推理一致性;因果忠诚度评分(CFS),测试引用的概念是否通过概念消融驱动预测;扰动稳定性评分 (PSS),用于衡量保留语义的释义的鲁棒性。通过评估 6 位LLM的 150 个 MedQA-USMLE 问题(900 个模型问题观察),我们发现所引用的临床概念中只有 23.3% 是因果必要的。正确答案的 CFS 低于错误答案(0.212 与 0.398),答案一致性对 CFS 产生负面预测(Spearman r = -0.466),模型对可以就答案达成一致,但仅共享 8.8% 的引用推理概念。这些结果表明,准确性、一致性和共识对于临床决策支持来说是不完整的安全信号。证据是行为性的而不是机械性的:概念消融测试的是输出的反事实敏感性,而不是内部电路。