论文

临床时间推理中的事后偏见:未来数据暴露如何影响大型语言模型判断

Hindsight Bias in Clinical Temporal Reasoning: How Future Data Exposure Affects Large Language Model Judgment

模型评测模型行为与机制分析

摘要

临床决策是前瞻性的,但临床语言模型通常根据回顾性记录进行评估,以揭示最终诊断、治疗反应和结果。此类评估可能会奖励使用未来信息,而不是在决策点存在的不确定性下进行推理。我们引入了一个配对基准,用于测量与临床时间推理中的后见之明偏差一致的结果条件变化。它包含来自 PubMed 中心开放获取子集的 171 个病例报告——40 个脓毒症病例和 131 个 GLP-1/糖尿病病例——以文本叙述和人工注释以及大语言模型生成的文本时间序列 (TTS) 的形式表示。对于每个案例,问题都与临床上有意义的截止值相关联,并与前瞻性参考答案和结果一致的\emph{事后陷阱}配对。模型使用在截止点截断的 TTS 或完整的时间线来回答每个问题;附加条件因叙述来源(原始或合成)和 TTS 注释来源(人类或大语言模型)而异。我们评估准确性 (Acc)、事后陷阱率 (HTR)、答案不稳定率 (AIR) 和事后偏差率 (HBR),每个指标都捕获不同的事后偏差信号。在 GPT 5.6 Sol、Gemma 4、GLM 5.2 和 Opus 5 中,完整时间线曝光会产生一致的事后敏感变化,而时间掩蔽可在不降低准确性的情况下减少偏差。