论文
多模式 LLM 准备好用于临床皮肤科了吗?皮肤病学的真实评估
Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology
摘要
多模式 大语言模型 (MLLM) 在公开的皮肤病学基准上表现出了良好的前景。然而,基准性能可能无法推广到现实世界的皮肤科决策。为了量化这一基准与床边差距,我们评估了四个开放权重 MLLM(InternVL-Chat v1.5、LLaVA-Med v1.5、SkinGPT4 和 MedGemma-4B-Instruct)和一个商业 MLLM (GPT-4.1),涵盖三个公开的皮肤病学数据集和一个回顾性多地点医院皮肤病咨询队列,该队列包含 5,811 例病例和46,405 个临床图像。在两项临床相关任务上评估模型:鉴别诊断生成和基于严重程度的分类。公共数据集上的诊断性能一般,而在现实世界中的诊断性能则大幅下降。在公共基准测试中,最佳开放权重模型的 top-3 诊断准确率达到 26.55%,GPT-4.1 的诊断准确率达到 42.25%。在仅使用图像的真实咨询案例中,开放权重模型中的 top-3 诊断准确率下降至 1.50%-13.35%,GPT-4.1 的诊断准确率下降至 24.65%。结合临床背景提高了所有模型的性能,将开放权重模型中的 top-3 诊断准确率提高到 28.75%,将 GPT-4.1 提高到 38.93%。然而,模型输出对不完整或错误的咨询上下文高度敏感。对于基于严重程度的分类,模型达到了中等敏感性(60% 以上),表明其具有潜在的筛查效用,但临床部署的可靠性不足。这些发现表明,基准性能大大高估了当前皮肤科 MLLM 的实际临床能力。