论文

CardioBench:用于在临床真实心血管护理场景中评估 大语言模型 的真实数据基准

CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

模型评测基准与评测资源

摘要

背景:大多数医学 大语言模型 (LLM) 基准侧重于检查知识或孤立的任务,可能无法反映心血管护理的纵向、多模式和安全关键的工作流程。目标:开发 CardioBench,一个跨越心血管护理连续体的现实基准,并评估 LLM 在临床维度和专业任务中的表现。方法:CardioBench 包括来自 13 个特定任务数据集的 2,263 个项目,这些数据集源自去识别的心血管记录和检查数据。十六位心脏病医生进行了注释和参考构建,然后由两位资深心脏病专家进行交叉审查。七个 LLM 在标准化零样本设置下生成 15,841 个输出。开放式任务使用关键点覆盖率和整体临床质量进行评估,而心脏伦理学则根据准确性进行评分。结果:GPT-5.4 取得了最高的宏观平均值(62.55)和项目加权平均值(62.19),其次是 Gemini 3.1 Pro(59.95)和 Qwen 3.6 27B(59.72)。 GPT-5.4在三个维度上均排名第一。 CardioAuxReport 表现最佳 (86.38),而 CardioECGRead (17.25) 和 CardioEthics (17.34) 最低。整体临床质量和关键点覆盖率之间的最大差距出现在 CardioComm (52.71)、CardioEmergRescue (52.05) 和 CardioTreatPlan (48.80) 中。结论:据我们所知,CardioBench 是整个心血管护理连续体中 LLM 评估的最大的现实世界多任务基准,并提供迄今为止报告的临床真实心脏病学场景的最广泛覆盖范围。它提供了一个严格的框架来识别模型的优势、临床上重要的遗漏以及未来发展的优先事项。