论文
LLM 准备好协助医生了吗?用于交互式医患 EHR 协助的 PhysAssistBench
Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance
摘要
医疗 LLM 最合理的近期作用是协助而不是取代医生,但当前的评估经常测试孤立的能力:临床知识、EHR 系统交互或患者沟通。相反,医生的协助需要在同一交互中协调这些功能,其中医生发出未指定的请求,患者模糊地描述症状,并且 EHR 系统需要精确的工具使用。我们推出 PhysAssistBench,这是交互式医患 EHR 协助的基准。 PhysAssistBench 以真实的 MIMIC-IV 病例为基础,使用可扩展的管道来构建代理患者:交互式、基于记录的代理,可将静态 EHR 记录转变为多轮临床场景,同时保留临床事实。 PhysAssistBench 提供精心策划的双语评估集,其中包含 1,296 个手动审核和医生验证的回合。领先的 LLM 的实验表明,当前模型在这种情况下仍然不可靠,这暴露了临床 LLM 的一个关键瓶颈:可靠的援助需要跨知识、沟通和系统的协调,而不是其中任何一个的孤立收益。