论文

LLM临床判断随证据演化的不可靠更新

Large language models exhibit unreliable updating of clinical judgment as patient evidence evolves

应用与实践行业应用

摘要

大语言模型日益被探索用于临床推理,但它们能否随患者证据演化恰当地修正判断仍不清楚。我们用电子健康记录中匹配的ICU轨迹评估纵向信念更新。跨多个LLM,当估计变化时,以前一判断为条件更多是增加而非降低预测误差,第二终点复现。受控干预揭示两种失败模式:固定前一评估时,模型对恶化的呼吸证据比匹配的改善证据反应更强——该不对称在中等与强证据水平经余量归一化后仍持续;固定当前证据时,把先验风险从10%提到90%使估计移动26.2个百分点,证明模型先验信念的因果影响。提示工程无法恢复可靠更新。证据验证的纵向更新(EVLU)识别出更少但更可靠的修订,揭示可靠性-覆盖权衡。这些发现把纵向信念更新确立为LLM可靠性的独立维度。