论文
EHR-Complex:面向复杂临床推理的医疗智能体基准
EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning
摘要
临床智能体有望使电子健康记录(EHR)访问民主化——但既有基准未能反映实际EHR分析的复杂性——例如常经静态SQL生成在理想化、干净的EHR上运作而非交互式执行。本工作中——我们介绍EHR-Complex——为交互式临床数据库推理设计的大规模基准。EHR-Complex建立在大型MIMIC-IV基底上(36.5万患者、31表、5亿+记录)——含约5.2万任务、横跨六种临床意图——支持患者级与人群级查询——每任务要求智能体在沙箱环境中经执行SQL查询或Python代码交互。值得注意的是——EHR-Complex考虑纵向多表聚合与组合推理的真实SQL任务复杂度——平均每查询31.93个SQL结构组件。EHR-Complex上的评估结果揭示这些EHR推理场景的临床难度:最佳模型仅达62.3%精确匹配准确率。几乎所有受评模型的Pass^k一致性在k=4时跌破50%——暴露广泛的随机脆弱性。对代表性LLM超3,800条失败轨迹的细粒度分析揭示三种主导失败模式:SQL逻辑错误、医学代码查找失败与语义误解。EHR-Complex为临床智能体提供严格测试台——并凸显大规模EHR分析鲁棒推理的剩余缺口。
