论文

忠实还是仅仅貌似合理?评估闭源大语言模型在医学推理中的忠实性

Faithful or Just Plausible? Evaluating the Faithfulness of Closed-Source LLMs in Medical Reasoning

模型评测鲁棒性、公平性与可信度评测

摘要

诸如 ChatGPT 和 Gemini 等闭源大语言模型(LLM)越来越多地被用于咨询医疗建议,然而其解释可能看似合理,却未能反映模型的底层推理过程。这一差距带来严重风险,因为患者和临床医生可能信任连贯却具有误导性的解释。我们对三个广泛使用的闭源 LLM 开展了医学推理忠实性的系统性黑盒评估。我们的研究包含三种基于扰动的探测:(1) 因果消融,检验所陈述的思维链(CoT)推理是否因果性地影响预测;(2) 位置偏差,考察模型是否为受输入位置驱动的答案编造事后合理化;(3) 提示注入,测试模型对外部暗示的易感性。我们还以一项小规模人类评估补充这些定量探测,评估模型对患者式医疗查询的回复,以考察医生对解释忠实性的评估与外行对可信度感知之间的一致性。我们发现 CoT 推理步骤往往并不因果性地驱动预测,且模型会轻易吸收外部暗示而不加声明。相比之下,位置偏差在这一情境中影响甚微。这些结果强调,在评估面向医学的 LLM 时,忠实性而非仅仅是准确性必须成为核心,以同时保障公众保护与安全的临床部署。

忠实还是仅仅貌似合理?评估闭源大语言模型在医学推理中的忠实性:论文配图
图1:两项实验设置:实验二对比无偏、偏向正确(bias→gold)与偏向错误(bias→wrong)条件下模型选择B选项的比率。