论文

PhysicianBench:在真实EHR环境中评测LLM智能体

PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments

智能体系统Agent任务评测长程任务评测

摘要

我们提出PhysicianBench,一个在电子健康记录(EHR)环境的真实临床 setting 中评测LLM智能体完成医生任务的基准。现有医疗智能体基准主要聚焦静态知识回忆、单步原子动作或不带可验证环境执行的意图,因而无法捕捉真实临床系统的长程复合工作流。PhysicianBench包含100个由全科与专科医生真实会诊案例改编的长程任务,每个任务由独立医生小组评审。任务在带有真实患者记录的EHR环境中实例化,通过商业EHR厂商所用的相同标准API访问。任务横跨21个专科(如心血管、内分泌、肿瘤、精神科)与多样工作流类型(如诊断解读、开药、治疗规划),平均每个任务需要27次工具调用。求解每个任务需要跨就诊检索数据、对异构临床信息推理、执行有后果的临床动作并产出临床文书。每个任务被分解为结构化检查点(全基准共670个),由任务专用脚本以依据实际执行结果验证评分。跨13个专有与开源LLM智能体,最佳模型仅达46%成功率(pass@1),开源模型最高19%,揭示当前智能体能力与真实临床工作流需求之间的巨大差距。PhysicianBench为衡量迈向自主临床智能体的进展提供了真实且依据实际执行结果的基准。

PhysicianBench:在真实EHR环境中评测LLM智能体:论文配图
图1:PhysicianBench各模型总表现排名(按pass@1成功率),开源与专有差距一目了然。