论文
评估腐败和偏见下医学图像质量评估的 VLM 可靠性
Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias
摘要
视觉语言模型(VLM)越来越多地应用于病理描述、报告生成和视觉问答等医疗任务中。医学图像质量评估 (MIQA) 通过确定图像是否符合临床决策所需的标准来支持诊断准确性和患者安全。使用 VLM 实现 MIQA 自动化可能会减少工作量,但在部署之前应进一步探讨它们在现实条件下的行为,其中图像可能会降级或文本上下文可能会影响判断。我们使用 MediMeta-C 数据集零样本测试了 VLM 的医学图像质量,涵盖七种损坏类型和五个严重级别。我们评估对退化模式的敏感性、腐败对嵌入几何的影响,以及文本属性(人口统计、专业知识、基础设施、机构)是否改变分数。在 16 个 VLM 和 7 种模式中,像素化产生的分数降低幅度最大(平均值为 -20.58%,OCT 高达 -34.4%),而亮度的影响有限(-0.81%)。嵌入位移与分数变化相关。同族模型显示相关性为 0.67-0.83;一些产品对于损坏的乳房 X 光检查增加高达 +31%。文本属性影响分数:机构声望将分数提高了+17.15%,设备年龄将分数降低了-14.7%。最大变化为 +95.62% (InternVL-8B) 和 -37.7% (MedGemma)。当前的 VLM 在医学图像质量评估方面存在局限性。像素化是一种隐私保护转换,会降低性能,表明患者隐私和可靠性之间需要权衡。对上下文元数据的敏感性表明客观性有限,并将元数据标记为隐私和偏见来源。隐私保护和客观质量评估是使用的相关要求。