论文
大语言模型在医学推理中表现出元认知敏感性
Large Language Models Show Metacognitive Sensitivity in Medical Reasoning
摘要
大语言模型(LLM)越来越多地在医学领域被评估和使用,但临床有用性既取决于答案准确性,也取决于置信度是否跟踪证据质量与不确定性。我们开发了一个受控的、受心理物理学启发的临床基准,用于测试医学LLM的诊断选择与置信度行为。该基准聚焦于很可能为阿尔茨海默型神经认知障碍(AT-NCD)与抑郁相关认知障碍(DRCI)的鉴别。我们生成了45个合成病例短文,变化证据强度、冲突证据和缺失信息。每个病例以三种提示变体呈现,共产生135次试验。在对gpt-4.1-nano的试运行中,所有试验都产生了有效的结构化输出。在强制选择试验中,诊断准确率为93.5%,平均置信度为78.4%,AUROC2为0.876。置信度随证据离诊断边界的距离增加而上升,在信息缺失时下降,且在校正证据强度和提示格式后,正确试验上的置信度仍高于错误试验。这些发现表明存在部分元认知敏感性,而非全局无信息的置信度。然而,错误集中在中等程度、有冲突的AT-NCD病例上,模型在这些病例上转向DRCI并保持了高于经验准确率所支持的置信度。模型比较提示,置信度质量应被直接测量,而不是仅从基准准确率或模型能力推断。本研究建立了一个可复现框架,用于评估医学LLM的证据敏感性、元认知敏感性和局部校准失败。
