论文

CliniCARE-Bench:基于电子病历的临床校准式医学推理审计

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

智能体系统Agent任务评测

摘要

大语言模型在医学知识基准上表现强劲,但可靠的临床部署要求智能体在异构、纵向记录上进行可辩护的调查:判断需要哪些证据、检索并核对结构化与自由文本数据、让结论立足于可验证证据,以及对无法可靠解决的病例予以搁置。我们提出CliniCARE-Bench(Clinical Calibrated Audit of Medical Reasoning in EHR),一个面向回顾性临床审计的基准:25个经临床医生验证的场景,基于真实患者衍生的MIMIC-IV数据实例化为750个患者级病例。系统通过一个受治理、留痕的工具环境(用于记录检索、计算与政策访问)对每个病例开展调查,并返回四种裁决之一——是、否、不确定:缺乏数据,或不确定:医学上存疑——后两类将证据缺失与残余医学不确定性区分开来。除裁决准确率外,我们还依据由独立多模型裁定产生、并经临床委员会评审校准的病例级参考裁决,为患者-证据与政策锚定、流程遵从、校准式弃权、可靠性与效率打分。每次检索、计算与报告均可回放,因此调查轨迹可查验、可评分。据我们所知,CliniCARE-Bench是首个在统一的患者级裁定框架内,联合评估真实纵向EHR调查、断言级证据锚定、治理政策使用、流程遵从与校准式弃权的面向部署的临床智能体基准。在16个agentic系统上,四分类准确率介于65.3-76.1%,但原始准确率高估了调查质量。无缺陷准确率(只有当裁决正确且无违规捷径时才计分)要低4.8-14.8分,并重排了排行榜。

CliniCARE-Bench:基于电子病历的临床校准式医学推理审计:论文配图
图7:两个安全攸关的Indeterminate类别上的性能崩溃。完整队列中全部十六个系统的逐类F1(行按排行榜顺序排列,通过左侧色条按harness分组)。在较弱系统上,Yes和No保持强势,而两个deferral类别(虚线框)明显下滑。deferral类别的精确率整体偏低(lack类为46–67%,amb类为26–65%),见表14。