论文
EHR-RobustGym:稳健临床推理的基准测试和训练Agent
EHR-RobustGym: Benchmarking and Training Agents for Robust Clinical Reasoning
摘要
在医院工作流程中,电子健康记录 (EHR) 通常很嘈杂,并且可能不包含确认临床查询中引用的事件或测量值所需的证据。即使数据库检索成功,临床Agent也可以忽略此类差异并返回看似合理但不受支持的答案。我们推出了 EHR-RobustGym,这是一个可扩展的交互式环境,用于评估和训练基于嘈杂 EHR 的强大临床Agent。 EHR-RobustGym 基于 MIMIC-IV 医院记录(365K 患者、31 个表格和超过 5 亿条记录)而构建,包含 5,486 个 Clean-Noise 对,涵盖六个临床意图以及患者级和人群级查询。这些对测试对记录级、值级和查询级噪声的鲁棒性,而交互式 SQL/Python 执行和结果验证支持轨迹收集和训练。评估多个大语言模型揭示了巨大的鲁棒性差距:专有和大规模开放权重模型的平均任务成功率从清洁问题的 62.2% 下降到噪声问题的 37.9%。在 k=4 时,大多数评估模型的 pass^k 一致性降至 50% 以下,暴露出临床任务完成的不稳定性。 EHR-RobustGym 中的监督微调和强化学习提高了性能,并将收益推广到五个外部 EHR 基准。总之,这些结果使 EHR-RobustGym 成为评估和提高临床药物循证鲁棒性的测试平台。