论文
根据患者拍摄的皮肤图像对现成的多模式 AI 模型与皮肤科医生进行基准测试
Benchmarking Off-the-Shelf Multimodal AI Models Against Dermatologists on Patient-Captured Skin Images
摘要
近年来,人工智能(AI)发展迅速。最初,大型语言模型的突破引起了广泛关注。然而,最近几代前沿人工智能模型已经将多模态能力作为一等公民,其中视觉能力是其中的核心。在本文中,我们评估了最近发布的三个模型,用于根据患者提交的图像诊断皮肤病。所选模型的定价处于中低端,因此代表了当前人工智能功能的下限,而不是上限。我们相对于由三名经过认证的皮肤科医生组成的小组来评估人工智能的性能,他们对每张图像进行评分,并提出了四个有趣的发现。首先,根据指标,测试的人工智能模型在临床医生间一致性方面要么与人类持平,要么稍稍落后于人类。其次,我们发现向人工智能模型询问置信度会产生校准不佳的答案,这意味着在临床环境中不应依赖置信阈值的使用。第三,提供额外患者元数据的效果很大程度上取决于模型,三个模型之一在考虑的每个指标上都会降低。最后,模型成本并不能预测性能。我们测试的性能最佳模型的平均成本为每个案例 0.0045 美元。