论文
使用标准化患者病例评估 大语言模型 在动态临床决策中的作用
Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases
摘要
大语言模型 (LLM) 越来越多地被提议作为临床代理,但静态的单轮基准无法捕捉模型如何在整个遭遇中动态提供护理:收集信息、规划治疗以及在连续的患者状态中调整纵向管理。医学教育长期以来一直通过标准化患者(SP)来解决类似的挑战:训练有素的演员不断地描绘临床病例,从而实现现实的实践和客观的、脚本化的评估。在这里,我们介绍 MedSP1000,这是一种源自 SP 的用于临床药物评估的交互式基准,包括 1,638 个 SP 病例和 24,602 个轨迹级同行评审的量规。 MedSP1000 将经过同行评审的 SP 教学案例转换为可执行场景,其中包含定义的 SP 案例脚本、临床环境上下文和经过人工验证的结构化量规。在每次模拟评估运行中,临床代理与患者代理和环境控制器在闭环中交互,并且在整个遭遇过程中根据原始材料中指定的专家标准对其行为进行评分。将 MedSP1000 应用于一系列通用和医学专用 LLM,我们发现静态基准测试的性能并不能可靠地转化为此类教育场景。表现最好的模型 GPT-5.5 仅完成了专家定义的评分标准项目的 60.4%,而最强的医学专业模型达到了 40.0%;增加测试时间计算不会产生可测量的增益。这些结果表明,当前的 LLM,包括针对医学调整的代理系统,还不够可靠,无法安全地融入实际临床实践。更广泛地说,MedSP1000 展示了过程级、SP 式评估如何揭示单轮基准测试遗漏的临床相关故障模式。