论文

肤色上的疾病负担:打破皮肤病学与人工智能的泛化差距

Disease Burden over Skin Tone: Decomposing the Dermatology-AI Generalization Gap

模型评测鲁棒性、公平性与可信度评测

摘要

皮肤科人工智能 (AI) 模型主要针对浅色皮肤、以癌症为中心的图像集进行训练,但越来越多地建议将它们部署在资源有限的环境中,在这些环境中,患者与训练人群在两个混杂的轴上存在差异:肤色和疾病分布。我们研究了泛化不良是否主要是由肤色代表性不足或疾病分布变化引起的。我们评估了经过癌症训练的基线(在 HAM10000 和 ISIC 2019 上微调的 ResNet-50)、两个皮肤病学基础模型(DermLIP 和 MONET)以及通用视觉模型(DINOv3)作为冻结特征提取器。在色调分层疾病匹配数据集(多样化皮肤病学图像,DDI)和疾病转移色调多样化数据集(皮肤状况图像网络,SCIN)上评估模型。我们的结果表明,在评估的环境中,疾病分布变化的贡献不仅仅是肤色。当转移到不熟悉的临床条件时,癌症基线的平衡精度从 0.62 降低到 0.21,而疾病内肤色差距更小 (0.10-0.18) 并且不一致。无标签表示分析表明,这种失败反映了表示限制,而不仅仅是缺少输出标签:癌症专用特征对不熟悉的条件的聚类效果较差(kNN 纯度提升 +0.06 高于偶然),而皮肤病学预训练的特征保留了更强的可转移结构(+0.23)。最后,我们表明表示质量可以预测轻量级适应下的可恢复性能。从皮肤病学基础模型开始,每个临床类别大约有十个标记示例恢复了最可达到的性能。我们发布了评估协议和代码,以支持皮肤病学人工智能泛化的可重复审核。