论文

EHR-Complex:面向复杂临床推理的医疗智能体基准

EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning

智能体系统AI 基础设施Agent任务评测SandboxAgent Sandbox

摘要

临床智能体有望使电子健康记录(EHR)访问民主化——但既有基准未能反映实际EHR分析的复杂性——例如常经静态SQL生成在理想化、干净的EHR上运作而非交互式执行。本工作中——我们介绍EHR-Complex——为交互式临床数据库推理设计的大规模基准。EHR-Complex建立在大型MIMIC-IV基底上(36.5万患者、31表、5亿+记录)——含约5.2万任务、横跨六种临床意图——支持患者级与人群级查询——每任务要求智能体在沙箱环境中经执行SQL查询或Python代码交互。值得注意的是——EHR-Complex考虑纵向多表聚合与组合推理的真实SQL任务复杂度——平均每查询31.93个SQL结构组件。EHR-Complex上的评估结果揭示这些EHR推理场景的临床难度:最佳模型仅达62.3%精确匹配准确率。几乎所有受评模型的Pass^k一致性在k=4时跌破50%——暴露广泛的随机脆弱性。对代表性LLM超3,800条失败轨迹的细粒度分析揭示三种主导失败模式:SQL逻辑错误、医学代码查找失败与语义误解。EHR-Complex为临床智能体提供严格测试台——并凸显大规模EHR分析鲁棒推理的剩余缺口。

EHR-Complex:面向复杂临床推理的医疗智能体基准:论文配图
图 2:EHR 复合体建设流程。步骤1:基于完整的MIMIC-IV底物,导出患者事件图以用于后续的成分推理。步骤 2:从事件图中提取临床证据路径作为 SQL 查询候选。步骤 3:临床证据路径被编译成经过执行验证的 SQL 模板。这些模板被具体化为跨越六个临床意图的患者和人群层面的问题。 EHR-Complex 提供用于交互式 SQL/Python 执行的环境沙箱。