论文

评估用于住院诊断的多模式 LLM:十个前沿模型的真实性能、安全性和成本

Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

模型评测模型能力评测

摘要

背景:大语言模型 (LLM) 越来越多地被提议用于诊断支持,但很少有评估使用真实世界的多模式住院患者数据,特别是在中低收入国家 (LMIC) 公立医院。方法:我们对南非一家三级公立医院的 539 例多模式住院病例进行了 VALID 回顾性评估。输入包括放射成像(CT、MRI、CXR)和报告、实验室结果、临床记录和生命体征。专家小组对 300 个病例(平衡和不一致子集)进行了裁决,以建立 真值 诊断、差异和推理。十个多模态 LLM 生成零样本输出。经过校准的三模型 LLM 陪审团对所有输出和常规病房诊断的诊断准确性、差异质量、推理和患者安全进行评分(>10,000 次评估)。主要结果是综合分数($S_3$、$S_4$)和胜率。结果:(i) 尽管成本差异很大,但 LLM 性能紧密聚集(<15% 变异);低成本型号的性能与顶级型号相当。 (ii) 所有 LLM 在平均诊断和安全评分方面均显着优于常规病房诊断。 (iii) GPT-5.1 实现了最高性能,其次是 Gemini 模型。 (vi) 添加放射学报告将性能提高了 6%。 (v) 诊断和推理得分高度相关 ($ρ= 0.85$)。 (vi) 由于投入限制,产出率有所不同(65-100%)。跨子集和评估设计的结果都是稳健的。结论:在现实世界的 LMIC 数据集中,尽管成本差异较大,但多模式 LLM 表现出相似的诊断性能,并且在平均安全指标上优于常规护理。在中低收入国家环境中,可承受性、稳健性和部署限制可能超过边际性能差异。