论文
医疗 VLM 如何充分利用其视觉编码器:皮肤病学角度
How Medical VLMs Underutilize Their Vision Encoders: A Dermatology Perspective
摘要
医学视觉语言模型 (VLM) 在临床图像理解方面显示出巨大的前景,可以通过可解释的推理提供准确的诊断。然而,其强大的视觉编码器和完整的多模态模型之间存在关键的性能差距:在皮肤病学中,即使两者都使用零目标任务标签,MedSigLIP 编码器的性能仍比 MedGemma 平均高出 10.26 个百分点;少样本线性探测提供了强烈视觉表征的进一步证据。这一差距促使人们研究如何在端到端诊断中使用视觉信息,以及为什么听起来合理的预测可能缺乏图像证据的基础。使用皮肤病学作为我们的主要测试平台,我们系统地研究了这种现象的三种假设。我们进一步对模型的内部注意力模式进行了机制分析,表明简单的“描述然后决定”提示策略可以在生成过程中将视觉注意力提高 30-40%。在我们的评估中,特定于任务的微调改善了皮肤病学分类,但降低了跨领域医学问答性能。为了应对这些挑战,我们将无标签提示与低标签编码器辅助重排序相结合,同时保持 VLM 冻结。我们验证了皮肤病学领域五个 VLM 主干的干预措施,并提供了跨其他医疗模式的支持性代表性和注意力分析。