论文

组合推理深度预测临床人工智能失败:与电子健康记录问答中的 Transformer 组合性限制一致的经验证据

Compositional Reasoning Depth Predicts Clinical AI Failure: Empirical Evidence Consistent with Transformer Compositionality Limits in Electronic Health Record Question Answering

模型评测评测方法与指标

摘要

总体准确性基准隐藏了 大语言模型 如何在电子健康记录 (EHR) 问答中失败的系统结构:需要更多推理步骤的问题会产生不成比例的更多错误。受 Transformer 组合性限制理论结果的启发,我们引入了预先指定的跳数分类法(从 EHR 回答临床问题所需的不同推理步骤的数量),作为模型失败的原则预测因子。我们对 4 个跃点级别的 313 个临床医生生成的 MedAlign EHR 问答对进行了注释,并在模型内消融(claude-sonnet-4-6,零样本与扩展思维)和跨架构复制(gpt-4o 和 gpt-5.4-2026-03-05,零样本)中评估了 301 个问题。跨越两个提供商和两代 OpenAI(GPT-4 和 GPT-5)的所有三个模型都显示出随着跳数的增加,准确度单调下降:Claude Sonnet 零样本从 30.6%(hop=1)下降到 17.6%(hop=4)(Cochran-Armitage z=-2.30,p=0.011;OR 每跳 0.72,95% CI [0.56,0.92],p=0.008); GPT-4o 复制了这一点(37.8% 至 14.7%;OR 0.58 [0.45,0.75],p<0.001); gpt-5.4-2026-03-05 证实了这一点(37.8% 至 23.5%;OR 0.80 [0.66,0.98],p=0.027)。预先指定的上下文充分性审计显示,较高跳数的问题并没有因 EHR 截断而处于不同的劣势(第 2-4 跳的回答率为 93-95%,第 1 跳的回答率为 79%),因此下降反映了组合推理的难度。扩展思维并没有显着使三个推理条件下的准确度-深度曲线变平,并且思维标记的使用随跳数缩放(r=0.31,p<0.0001),与预测的 O(k) 计算要求一致。因此,跳数是 EHR 问答中大语言模型错误的理论驱动的跨架构预测器,对临床人工智能的部署风险分层具有直接影响。