论文
ClinicalMC:面向大语言模型多课程临床决策的基准
ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language Models
摘要
大语言模型(LLM)已在医疗保健领域广泛采用,但在复杂的临床决策场景中仍然遇到重大挑战。现有的基准主要评估单课程环境中的大语言模型表现,缺乏对多课程场景的系统评估,在多课程场景中,患者的病情会随着时间的推移而变化。为了解决这一差距,我们提出了 ClinicalMC,这是多课程临床决策的基准。它包括从入院到出院四个阶段的 1,275 个中文样本和 5,804 个英文样本。这些阶段包括分诊、首程检查/诊断/治疗、后续多程检查/评估/治疗以及最终诊断。在 ClinicalMC 中,英语数据集中的患者平均经历 5.11 个临床课程,而中文数据集中的患者平均经历 3.42 个临床课程。为了评估大语言模型的表现,我们构建了一个多主体评估框架,其中包括患者、审查员和医生Agent。基于基准和框架,我们设计了两种实验设置——单轮静态设置和多轮动态设置——并评估三类LLM:1)闭源LLM,如GPT5-mini; 2)开源大语言模型,如DeepSeek-V3.2; 3) 医学大语言模型,如 HuatuoGPT-o1。通过广泛的评估,我们旨在更好地了解大语言模型在医疗领域的表现,并支持其在医疗保健领域的有效部署。
