论文

RESPClinBench:呼吸专科护理中多模式临床决策和纵向疾病管理的基准测试

RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

模型评测基准与评测资源

摘要

背景:呼吸专科护理需要多模式解释、纵向风险评估、指南一致干预和全程管理,而以检查为导向的医学基准很难体现这些。目标:开发 RESPClinBench,一个基于真实场景的呼吸系统临床决策基准,并评估 AECOPD-PIM 和 PNBIM 中的七个当代 大语言模型。方法:RESPClinBench 病例改编自去识别化的呼吸系统临床数据。三名主治呼吸科医生修改了病例、参考答案和原子临床行动要点,而一名高级呼吸专家则进行了交叉审查和最终裁决。 AECOPD-PIM 包括 427 例开放式 COPD 病例,PNBIM 包括 196 例结合胸部 CT 和结构化临床信息的多模态肺结节病例。七个模型通过标准化 API 推理生成了 4,361 个响应,温度为 0,最大输出长度为 8192 个词元。自动化框架将最终分数计算为原子动作回忆和基于评分标准的 LLM-as-a-Judge 评估的算术平均值。结果:623 例病例中,最终平均分为 68.58 分。 Qwen3.6-27B 以 71.22 分总体排名第一,Qwen3.5-397B-A17B 以 72.48 领先 PNBIM,Qwen3.6-27B 以 71.11 领先 AECOPD-PIM。 PNBIM 回答中 31.85% 和 8.16% 出现影像幻觉和严重医疗风险;药物安全风险和严重医疗风险分别占 AECOPD-PIM 反应的 26.93% 和 1.44%。结论:RESPClinBench 确定了多模式肺结节评估和纵向 COPD 管理中任务特定的局限性。结合明确的临床行动覆盖、整体评估和独立的安全标志,为模型选择和前瞻性验证提供了临床基础。